核对抓取限制,就是确认搜索引擎能否正常访问你希望被收录的页面,并把“服务器拒绝”“robots规则禁止”“页面指令阻止”“资源加载失败”分开定位。时间和人手有限时,先查影响面最大的全站级限制,再查栏目和单页,最后用抓取工具或日志验证,避免把收录问题误判成内容质量问题。
要查的是:搜索引擎抓取代理访问你的站点时,是否会先被robots.txt规则拦住。怎么查:直接访问/robots.txt,逐条看User-agent与Disallow,重点确认是否出现Disallow: /、是否误写了后台或栏目路径、是否把CSS和JS目录也屏蔽。结果说明什么:如果整站被禁止,收录和抓取会大面积受限;如果只屏蔽了无关目录,影响范围通常较小。注意,不同抓取代理的规则可能不同,要分别核对,不要只看一条。
要查的是:单个页面是否在HTML头部或HTTP响应头里声明了不抓取、不索引。怎么查:查看页面源代码中的<meta name="robots">,再用响应头检查工具看X-Robots-Tag。若出现noindex或none,该页面即使能抓取也不会进入索引;若出现nofollow,则影响链接跟踪。结果说明什么:页面级限制只影响对应URL,适合用来判断“为什么这条内容一直不出现”,而不是全站问题。
要查的是:服务器是否用状态码或限速阻止抓取。怎么查:对目标URL发起请求,观察返回码。200表示可正常访问;301或302表示跳转,要确认最终落点是否可抓;403表示服务器拒绝,可能是防火墙或权限规则;404表示页面不存在;429表示请求过多,可能触发限速;5xx表示服务器错误。结果说明什么:403和429往往不是内容问题,而是访问控制问题;5xx需要先修服务器稳定性,再谈抓取。若同一现象反复出现,可结合访问日志看抓取代理的请求频率和响应情况。
要查的是:CSS、JS和图片是否被robots.txt或服务器规则挡住。怎么查:在robots.txt中确认没有屏蔽资源目录,再用抓取测试工具查看渲染后的页面。结果说明什么:如果资源被阻止,搜索引擎可能无法正确理解页面结构和内容,移动端体验判断也会受影响。适用条件是:页面依赖前端渲染或关键内容由脚本插入时,这项检查优先级更高。
要查的是:上述规则修改后,抓取是否真的恢复。怎么查:用搜索引擎提供的抓取测试或URL检查功能请求单个URL,观察返回码、robots状态和渲染结果;同时查看服务器日志中该抓取代理的访问记录。结果说明什么:如果测试通过且日志出现正常请求,说明限制已解除;如果仍失败,要回到状态码或防火墙继续定位。一次改动前后比较要考虑季节、搜索需求变化和数据采集差异,不能只凭一天的数据下结论。
时间有限时,按这个顺序执行:先看robots.txt是否全站禁止,再看目标页面的meta robots和X-Robots-Tag,接着看状态码与限速,最后检查资源加载和日志。下一步,选一个当前最希望被收录的URL,按上述清单逐项记录结果,把“已定位的原因”和“可能原因”分开标注,再决定修改哪一条规则。