核对抓取限制,核心是确认搜索引擎能否正常访问页面、是否被规则主动挡住,以及挡的是整站还是局部。时间人手有限时,最先做的不是改内容,而是用抓取工具和日志把“进不来”的页面找出来,因为抓取受限会直接让后续优化失去意义。
抓取限制通常来自四个层面,核对前先分清对象,避免把不同问题混在一起:
robots.txt:站点级规则,声明哪些路径不允许抓取。<meta name="robots"> 或响应头中的 X-Robots-Tag,可控制索引与跟随。这四类要分开验证。一个页面不收录,可能原因很多,不能只凭“没排名”就断定是被 robots 挡住。
建议按以下顺序操作,每一步都留下记录,便于后续比较:
robots.txt,逐条读 Disallow 与 Allow,确认目标路径是否被覆盖。注意规则按前缀匹配,Disallow: /admin 也会挡住 /admin-guide 这类路径。最关键的一步是第三步与第四步对照:工具显示可抓取,但日志里爬虫请求很少,问题往往出在服务器拦截或站点结构,而不是 robots 规则。
核对完成后,按下表判断:
改动前后比较时,要考虑季节、搜索需求变化和数据采集差异,不能把一次波动直接归因于某次修改。抓取放开后也不会立即见效,应持续观察一段时间再判断。
抓取限制会随改版、上新、迁移而变化。建议在以下时机重新核对:上线新栏目、调整 robots.txt、更换服务器或 CDN、批量改 URL 结构。把核对清单固定下来,每次改动后跑一遍,比事后排查更省人力。
下一步:从日志中筛出最近一周返回 403、429 或 5xx 的 URL,按出现次数排序,先处理次数最多的那批。