先给结论:入口页面正常只说明该页面自身可被抓取和索引,不能证明从入口到深层页面的整条链路都通。批量查收录时出现“入口正常、深层失效”,最可能的断点是中间跳转层或深层页自身的可发现性。定位方法是把链路拆成三段,用可区分的证据逐段排除。
假设一个站点有三级结构:首页作为入口,分类页作为中间层,详情页作为深层。批量查收录时发现首页和分类页都有结果,大量详情页却查不到。这并不矛盾,因为入口页面的收录状态和深层页面的收录状态是独立判断的。
入口页面通常被外链、导航和站点地图反复指向,抓取优先级高。深层页面依赖中间层传递链接权重和抓取路径。一旦中间层出问题,深层页面在抓取层面就等于不存在,而入口页面完全不受影响。
面对同一个现象,至少要区分两种解释。
两种解释对应的修复动作完全不同。前者要修中间层的链接输出,后者要修详情页的渲染或响应。
关键证据来自“顺着链接走”而不是“直接访问”。
证据一:从入口页面出发的可达性。关闭脚本后从入口页逐层点击,记录能否到达深层页。如果手动输入深层页地址可以打开,但从入口点击走不到,断点在中间层。如果手动输入也打不开,问题在深层页本身。
证据二:中间层的链接输出。查看分类页的 HTML 源码,确认详情页链接是否真实存在于 <a href> 中。若链接只由脚本在浏览器端生成,抓取工具看到的中间层可能没有任何指向深层的链接。这是中间层断链的典型表现。
证据三:深层页的响应状态。直接请求若干深层页地址,记录 HTTP 状态码和正文是否包含目标内容。若大量返回错误状态或正文为空,说明断点在深层页。
把这三组证据放在一起,就能判断断点位置。入口可达、中间层无链接、深层页直接访问正常,指向中间层断链;入口可达、中间层有链接、深层页直接访问异常,指向深层页失效。
假设某分类页第一页有二十个详情页链接,第二页及之后改为无限滚动,链接由脚本在滚动时插入。抓取工具通常不执行滚动,因此从第二页起,中间层对抓取者来说没有指向深层的链接。
此时批量查收录的结果会是:入口和分类首页正常,第二页之后的详情页大量缺失。验证动作是关闭脚本后查看第二页源码,若源码中没有任何详情页链接,即可确认断点在中间层。修复方向是把分页改为可抓取的链接,或补充静态链接列表。修复后重新批量查收录,观察的应是深层页面是否开始出现,而不是入口页面的状态变化——入口本来就没有问题。
这套方法假设深层页面数量足够多、链路层级清晰。如果站点结构扁平,入口页直接链接所有深层页,就不存在中间层断点,此时应把注意力放在深层页自身。
另外,robots.txt 的抓取限制不等于可靠的索引移除,站点地图提交也不保证收录,HTTPS 同样不保证安全无漏洞或排名。这些因素可能同时影响深层页面,但它们各自作用在不同环节,需要分别核查,不能因为某一项配置正确就跳过链路排查。不同搜索引擎对脚本渲染和分页的处理方式不同,结论需要分别验证,不能用一个引擎的表现推断另一个。
定位断点的价值在于把修复动作限定在真正失效的那一段,避免在正常工作的入口页面上反复调整,也避免对深层页做无针对性的改动。