站长工具死链检查前需要准备哪些信息:先备好入口清单与状态基线

📍 WDQWDWQD987AAAAA:216.73.217.52
📱 Mozilla/5.0 AppleWebKit/537.36 (KHTML, like Gecko; compatible; ClaudeBot/1.0; +claudebot@anthropic.com)
🔗 /9dd18979b3e4.html
📄

站长工具死链检查前需要准备哪些信息:先备好入口清单与状态基线

检查死链前,至少要准备好四类信息:待检查的网址范围、站点允许抓取与禁止抓取的规则、可用于对照的历史链接记录,以及判断“死”的标准。缺少其中任何一项,站长工具给出的结果都可能被误读,比如把 robots.txt 拦截当成死链,或把尚未抓取的正常页面当成失效页面。

先确定要检查哪些网址,而不是把整站一次性丢进去

死链检查的第一步不是打开工具,而是划定范围。范围越模糊,结果越难处理。可按以下顺序整理:

如果站点已有站点地图,可以把它当作候选入口,但不要把它当成完整覆盖证明。站点地图只表示你希望被发现,不代表所有地址都已被抓取或索引。检查时应把站点地图地址、导航链接和实际内链分别记录,方便后续对比。

确认 robots.txt 与访问权限,避免把限制当成死链

robots.txt 的抓取限制不等于可靠的索引移除,也不等于页面不存在。如果工具报告某地址“无法访问”或“被阻止”,先核对 robots.txt 中是否禁止了对应目录,再检查服务器是否对工具所在网络返回了 403 或 429。

需要准备的判断信息包括:

只有排除这些限制后,返回 404 或 410 的地址才更接近真正的死链。返回 403 可能是权限问题,返回 429 可能是请求过多,返回 5xx 则更可能是服务端故障,不能直接按死链处理。

准备状态码基线与跳转记录,判断“死”的程度

同一个地址在不同时间、不同工具下可能得到不同结果,因此需要一份可对照的基线。基线不需要复杂,至少记录:

  1. 地址本身,以及它来自哪个页面或哪份清单。
  2. 首次发现异常的时间。
  3. 当时返回的状态码,例如 404、410、301、302。
  4. 跳转目标是否正常,跳转链是否过长。
  5. 该地址是否仍有外链或站内入口指向它。

举例来说,假设某旧活动页返回 301 并跳转到栏目首页,这不算严格意义上的死链,但若跳转目标与用户预期无关,仍应改为 410 或指向最接近的新内容。反之,若某地址返回 404,但站内已无任何入口、外链也已清理,它的处理优先级就低于仍被导航链接指向的 404 地址。

检查 HTTPS 与服务器配置,但不要把它当成安全或排名保证

HTTPS 不保证安全无漏洞或排名,它只说明传输层使用了加密。检查死链时,仍需分别核对证书是否过期、域名是否解析到正确主机、是否存在 http 与 https 两个版本互相跳转。若工具报告证书错误,应先处理证书与域名配置,再判断页面本身是否失效。

可执行的复查步骤是:先取一条异常地址,用浏览器无痕窗口访问,记录最终地址与状态;再对照 robots.txt、站点地图和服务器日志。若三者结论一致,才把该地址列入待处理死链。若不一致,先修正检查条件,而不是直接删除或改链。

把准备信息整理成一张可复查的表

开始检查前,把上述信息合并成一张表:地址、来源、robots 状态、首次状态码、最终状态码、跳转目标、是否仍有入口、处理动作、复查日期。这样做的价值在于,下次复查时能直接对比状态是否变化,而不是重新猜测。

下一步可以先用一小批入口页做试跑,确认工具能正常访问、状态码记录准确,再扩大到全站范围。若试跑中大量地址返回 403 或 429,应先调整抓取频率或访问权限,而不是继续扩大检查。

图1 图2

nginx