为什么需要提取链接
整理资料、做竞品采集、清理聊天记录、抓取页面里的外链时,经常要从一大段文字或 HTML 里把所有 URL 揪出来。肉眼找慢还漏,而且混着重复和无效链接。
本工具把文本/HTML 里的 http(s)、ftp、mailto、相对链接一次性提取成列表,支持去重、按域名分组、过滤站内链接,复制即用。
概念与公式
链接本质是符合 URL 语法的字符串。提取靠正则匹配协议头(https?://、ftp://、mailto:)或 <a href="..."> 标签里的地址。相对链接(如 /about)需要结合「基准域名」才能补全成绝对地址——本工具提供基准域名输入框来完成这一步。
处理逻辑:
- 用正则扫描全部候选链接;
- 去重(可选保留首次出现顺序);
- 按域名聚合或筛选(可选只留外链 / 只留某域名);
- 输出干净列表。
细分场景
- 资料采集:从长文里扒出所有参考文献链接。
- SEO 自检:查页面里有没有死链、有没有漏
https。 - 安全审查:快速看一封邮件 / 网页里指向了哪些外部域名。
怎么用本工具
把文本或 HTML 贴入输入框,勾选「去重」「仅外链」「按域名分组」等选项,结果即时以列表呈现。填了「基准域名」后,相对路径会被补全成绝对地址。
常见场景与实例
例:从 HTML 提取
贴入含 <a href="https://a.com"> 和 <a href="/b"> 的片段,设基准 https://x.com,得到 https://a.com 与 https://x.com/b。
例:去重 正文多次引用同一链接,勾选去重后只保留一条。
隐私说明
全程浏览器本地计算,不联网、不上传你粘贴的文本。