先给结论:把“被发现”当作唯一结果来分组,往往分不出原因。更有效的做法是按“入口是否指向该页”和“页面是否值得被抓”两个维度切分,形成四组对照,再逐组比较。对旧内容、旧系统或旧合作关系退出场景,这意味着不要一次性全站改规则,而是先选一批可回退的页面做对照。
假设你手上有 200 个 www 二级域名下的旧页面,其中 60 个被某个搜索引擎发现,140 个没有。若直接把 60 个归为“成功组”、140 个归为“失败组”,你会发现两组在内容质量、内链数量、发布时间上都混在一起,无法判断差异来自哪里。
原因在于“被发现”至少受三类因素影响:
这三类因素在“已发现/未发现”的分组里是混在一起的。你需要把它们拆开,让每组只在一个维度上有差异。
以你手中的旧页面清单为对象,按下面两个问题给每个页面打标:
交叉后得到四组:
划分完成后,先比较 A 组和 C 组。如果 A 组被发现的比例明显高于 C 组,说明入口可达性是主要变量;如果两组差异不大,说明入口不是唯一解释,需要继续看抓取日志和服务器响应。
假设你有 120 个旧页面,其中 40 个有站内链接、内容不重复(A 组),30 个无站内链接、内容不重复(C 组)。你先给 C 组中的 10 个页面各加一条来自相关页面的站内链接,保持其他条件不变,两周后观察这 10 个页面是否出现抓取记录。
如果这 10 个页面中有一部分开始被抓取,而同期未加链接的 20 个 C 组页面仍无抓取记录,你就有理由把“入口缺失”作为优先修复项。下一步不是全站加链接,而是先确认这些新增链接所在页面本身是否被抓取、是否被索引。如果链接所在页面自己都未被抓取,加链接不会产生预期效果。
这个例子的数字仅用于说明比较方法,不代表任何真实站点的比例或效果。
分组只是假设,验证要靠抓取日志。查看服务器日志时,重点看三件事:
如果 A 组页面在日志中频繁出现,C 组几乎没有记录,那么入口差异的解释力较强。如果 A 组和 C 组都很少出现,即使 A 组有入口,也要检查入口所在页面是否被有效抓取,以及站点地图是否真的被读取。
需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除。一个页面被 robots.txt 禁止抓取后,仍可能因为外部链接或历史记录而出现在结果中。同样,站点地图不保证收录,它只是提供发现路径,不构成收录承诺。
在旧内容退出场景中,你的目标通常不是让所有页面都被发现,而是保留仍然有价值的部分,让其余部分有序退出。对照组的作用是帮你判断哪些页面值得保留入口,哪些可以直接移除入口并观察。
建议的动作顺序:
这样做的结果是:你不会因为一批页面未被发现就全站放开抓取或全站提交站点地图,而是先确认哪一组对入口变化有反应,再把资源投向那一组。对需要退出的页面,也可以先移除入口、观察抓取量是否下降,再决定是否进一步处理。抓取量下降本身不能单独证明处理正确,它也可能来自服务器波动、站点整体抓取减少或季节性因素,需要结合同期其他页面的表现一起看。
最后,不同搜索引擎对站点地图、robots.txt 和索引移除的支持情况需要分别核查,不要假设一个引擎的表现可以直接套用到另一个引擎。把对照组保留在原清单旁边,每次调整只改一个变量,你才能在下一次批量决策时有据可依。