先给结论:当一批页面只有一部分被发现,对照组不应按“已发现/未发现”直接分组,而应先按主机与域名的组合方式分层,再在每一层内部比较“保留原状”“改写后重发”“退出该批处理”三种处置。这样做的原因是,未发现可能来自抓取路径、站点地图覆盖、robots限制、服务器响应差异或页面自身质量,只有先固定主机域名这一层变量,才能判断下一步该扩大处理还是收缩范围。
批量页面未全部被发现时,很多人会按URL目录或模板分组,例如把同一栏目下的页面放在一组。但如果这些页面分布在不同主机名、不同协议或不同域名下,模板相同并不能保证抓取条件相同。此时应把“主机域名组合”作为第一层分组依据:同一主机、同一协议、同一域名下的页面放一起;跨主机或跨域名的页面不要混入同一对照组。
动作上,可以先导出一张清单,字段至少包含:完整URL、主机名、协议、是否在站点地图中、最近一次已知响应状态、是否被robots规则限制。然后按主机域名组合切分。结果会直接影响下一步:如果未发现页面集中在某一个主机名或某一个协议下,优先检查该组合的抓取入口和响应,而不是继续改页面正文。
保留适用于:同一主机域名下,已发现页面和未发现页面在站点地图覆盖、内链路径、响应状态上基本一致,且未发现只出现在少量页面。此时不必立刻改写,先保留原状,只补充可抓取入口或修正站点地图遗漏。保留的前提是你能确认未发现不是由robots限制或服务器拒绝造成;robots.txt的抓取限制不等于可靠的索引移除,它只能阻止抓取,不能替代移除处理。
改写适用于:同一主机域名下,未发现页面与已发现页面在标题、正文主体或结构化信息上高度重复,且已发现页面已经占据相似查询意图。改写时只改一个变量,例如只调整标题与首段,不要同时改URL、内链和站点地图。结果如何影响下一步:如果改写后同一对照组内未发现比例下降,说明重复或质量是合理解释之一;如果没有变化,应回到主机域名层检查抓取路径,而不是继续批量改写。
退出适用于:某一主机域名组合长期只产生极低发现率,且该组合下的页面没有独立搜索需求、没有内链价值、也没有转化用途。退出不是删除,而是停止把该批页面作为重点观察对象,把资源转回有发现记录的组合。退出前要记录判断依据,避免把“请求量归零”或“抓取量下降”单独当成处理正确的证据,因为这些现象也可能来自抓取预算转移、站点整体改版或外部链接变化。
假设有一批页面分布在两个主机名上:A主机已发现比例较高,B主机已发现比例较低。不要直接得出“B主机有问题”的结论。先做三组对照:
如果差异只在“站点地图已列与未列”之间出现,优先补站点地图并观察;但站点地图不保证收录,它只是发现路径之一。如果差异只在“有内链与无内链”之间出现,优先补内链;如果差异只在响应状态之间出现,优先修服务器或应用层。只有当你排除了这些可区分原因,才考虑对B主机下的页面做改写或退出。
假设某批页面共200条,分布在两个域名下,其中120条属于主域名,80条属于备用域名。已发现页面共90条,主域名占85条,备用域名占5条。此时对照组应划分为:主域名-已发现、主域名-未发现、备用域名-已发现、备用域名-未发现。比较时先看同一域名内部差异,再看跨域名差异。
如果主域名内部未发现页面集中在某个子目录,而备用域名内部未发现页面分散且没有内链,那么下一步动作应是:主域名修子目录抓取路径,备用域名先停止批量提交,只保留有独立价值的页面。这个结果会影响后续判断:主域名的问题更像局部路径问题,备用域名的问题更像整体价值或入口问题,两者不应使用同一种改写策略。
选定一个主机域名组合,取其中10到20条未发现页面,保持其他条件不变,只补一条来自已发现页面的内链,并记录补链日期、目标URL、来源URL和下一次观察时的响应状态。这个动作的结果只有两种用途:如果同组内未发现数量下降,可以把补链扩展到同组其他页面;如果没有下降,不要立刻改写全部页面,而应检查该组是否被robots限制、是否返回异常状态、是否站点地图中根本未列。不同搜索引擎对站点地图、robots和索引处理的支持情况须分别核查,不能把一家观察结果直接套到另一家。
最后要记住:请求量、抓取量或某项统计归零,不能单独证明你的分组或处理正确;它可能来自抓取节奏变化、服务器日志采样差异或站点整体调整。对照组的意义是帮你排除合理解释,而不是给批量页面找一个统一答案。