网站死链怎样形成可复用检查清单:从一次假设的404排查说起

📍 WDQWDWQD987AAAAA:216.73.217.20
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /dbe57ebb0e1a.html
📄

网站死链怎样形成可复用检查清单:从一次假设的404排查说起

可复用的网站死链检查清单,核心不是把“检查死链”写成一个待办项,而是把发现、定位、修复、验证四个阶段拆成固定字段:URL、来源页面、HTTP状态、链接类型、处理动作、复查结果。这样下一次出现死链时,换一批URL仍能按同一张表推进,不必重新想流程。

先看一个假设例子:产品页改版后出现404

假设某站点把旧产品页统一改到新路径,但没有为旧URL设置跳转。三天后,站长工具里出现一批404。此时不要只导出404列表就结束,而应按下面的顺序收集证据。

  1. 从服务器日志或站点爬取结果中导出返回404的URL,记录状态码和首次发现时间。
  2. 对每个404 URL,查它被哪些页面链接:站内导航、文章正文、站点地图、外部来源都要分开记录。
  3. 判断链接类型:是<a href>普通超链接,还是图片、脚本、样式表、表单提交地址。不同类型处理方式不同。
  4. 确认旧URL是否还有等价内容。有,则设置301到最接近的新页面;没有,则返回410或保留404,并移除站内入口。
  5. 修复后重新抓取来源页面,确认链接已更新或跳转生效,再复查原URL的响应状态。

常见错误有三个:只改站内链接,忘了外部链接仍指向旧地址;把404全部跳转到首页,造成软404和用户困惑;把robots.txt里屏蔽某个路径当成删除死链的手段。抓取限制不等于索引移除,也不等于链接失效问题已经解决。

清单要固定哪些字段

字段固定,清单才能复用。建议至少包含以下列,并保持每次排查都填同一套:

如果站点规模很小,用表格软件即可;规模大时,可让爬虫导出CSV后按同一字段整理。字段不统一,清单就会退化成一次性记录,下次无法比较。

如何判断该跳转、该删除还是该保留

判断依据是内容等价性和用户意图,而不是“404越少越好”。

站点地图不保证收录,所以不能把“已从站点地图移除”当作死链已修复的证明。真正要复查的是:用户和爬虫访问该URL时,实际得到什么响应;来源页面上的链接是否还指向它。

把检查变成固定节奏

可复用还意味着触发条件固定。可以在以下时点运行同一张清单:改版上线前、批量删除内容后、更换域名或目录结构后、定期爬取发现新增404时。每次只更新数据,不重写流程。

执行时注意区分“可能原因”和“已经定位的原因”。例如某个URL返回404,可能是文件被删除、服务器配置错误、大小写不一致或重写规则失效;在未逐项验证前,不要只认定其中一个原因。HTTPS也不保证页面一定可访问,证书有效与链接有效是两件事。

下一步,先选最近一次出现的死链,按上面的字段建一张表,填完来源、状态码和处理动作;修复后隔一天再复查同一批URL,确认清单能闭环,再把它用于下一批。

图1 图2

nginx