网站死链检查,检查前需要准备哪些信息

📍 WDQWDWQD987AAAAA:216.73.216.165
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /cc0c46480916.html
📄

网站死链检查,检查前需要准备哪些信息

开始网站死链检查前,最需要准备的不是一款工具,而是一份可核对的清单:站点范围、URL来源、状态码判断标准、抓取限制文件、样本与记录方式。缺少这些信息,检查结果往往只能说明“某些链接打不开”,却无法定位是页面被删、服务器报错、跳转链路过长,还是抓取被限制。

先确定检查范围与URL来源

死链检查的第一步是明确“检查谁”。如果站点规模较大,建议先划定范围,而不是一次性抓取全站。需要准备的信息包括:

站点地图可以列出希望被发现的页面,但它不保证页面可访问,也不保证已被收录。因此,站点地图适合作为URL来源之一,不能当成完整清单。更稳妥的做法是把导航、栏目页和站点地图合并去重,再抽样确认。

确认抓取限制与访问权限

检查前要查看 robots.txt 是否限制了抓取。如果抓取工具被禁止访问某些目录,它可能把“无法抓取”误报为死链。需要区分:

robots.txt 的抓取限制不等于可靠的索引移除。它只约束爬虫行为,不能代替页面删除或状态码处理。检查前记录当前规则,有助于解释抓取结果中的空白和异常。

准备状态码与跳转的判断标准

不同检查工具对“死链”的定义可能不同。开始前应写清判断规则,例如:

  1. 404 和 410 计为失效链接。
  2. 301、302 若最终页面正常,计为可访问但需关注跳转链。
  3. 超时或连接失败单独归类,不直接判定为死链。
  4. 同一URL出现多次时,按首次发现位置记录来源页面。

假设某文章正文链接到 /old-page,该地址返回 301 并跳转到 /new-page,而 /new-page 返回 200。这个链接不是死链,但若跳转层数过多或目标页面与原文主题无关,仍应记录为待优化项。适用条件是跳转最终可达;判断结果是“可访问,但建议更新为最终地址”。

准备记录表与验收信号

检查前建立一张记录表,字段至少包括:来源页面、链接地址、状态码、最终地址、发现时间、处理状态。这样做的目的是让每个问题都能回溯到具体页面,而不是只得到一串URL。

可执行的验收信号可以设为:

如果检查范围包含外部链接,还要注意外部站点可能屏蔽抓取工具,返回403并不代表链接一定失效。此时应人工打开确认,或降低检查频率,避免把访问限制当成死链。

把准备信息变成一次可复现的检查

把域名范围、URL来源、robots.txt规则、状态码标准、记录表和复核方式准备好后,再运行抓取工具。检查结束后,先处理404和410,再处理跳转链和服务器错误。对无法确定的原因,保留原始状态码和来源页面,下一步用浏览器访问、服务器日志或命令行工具逐条复核,而不是直接批量删除链接。

图1 图2

nginx