遗留系统不能动模板,并不意味着抓取问题只能放着。可行的边界通常落在“系统外部可控制层”:服务器响应头、robots.txt、站点地图、内链与导航入口、日志监测。真正不能做的,是绕过模板去改页面级元标签、正文结构或渲染逻辑。判断该保留、改写还是退出,取决于页面价值、可改层是否存在,以及维护成本是否可持续。
遗留系统里常见的两类页面,处理方向不同。第一类是仍有独立搜索需求的详情页、文档页、商品页,它们值得保留,因为替换模板的代价高于在外部层做修正。第二类是参数组合页、会话页、重复筛选页,它们没有独立价值,继续保留只会消耗抓取预算,此时退出比修补更合理。
区分依据不是页面数量,而是三个可观察信号:这些 URL 是否持续获得外部链接或站内入口;日志中它们是否被反复抓取却很少带来访问;站内是否存在内容几乎相同的规范版本。若前两项为否、第三项为是,退出是更省成本的选择。若页面有独立内容且无法用其他 URL 替代,保留并做外部层修正更合适。
这里的退出不等于删除内容,可以是取消站内入口、停止站点地图提交、在 robots.txt 中限制抓取。需要提醒的是,robots.txt 的抓取限制不等于可靠的索引移除:已收录 URL 仍可能因外部链接而被访问,若目标是让页面从索引中消失,robots.txt 单独使用往往不够,还需要页面可返回明确的移除信号或直接下线。这个区别决定了“退出”动作该做到哪一步。
模板不可改,能动的层就剩下这些,按代价从低到高排列:
如果这些层都无法触及,说明系统外部也没有可操作空间,此时应把结论明确为“退出或替换”,而不是继续寻找不存在的页面级开关。
假设某遗留系统有约两千个带参数的筛选页,模板固定,无法加规范化标签。做法 A 是保留全部并提交站点地图;做法 B 是在 robots.txt 中限制参数路径抓取,同时只保留有独立内容的分类页入口。
做法 A 的代价是抓取请求分散,日志中大量参数 URL 被反复访问,真正需要更新的详情页抓取频率可能被压低。做法 B 的代价是部分参数页若已有外部链接,仍可能被访问,且 robots.txt 生效需要时间,短期内日志不会立刻归零。选择条件在于:参数页是否有独立搜索需求。若没有,B 的长期维护成本更低;若有,B 会误伤,应改为 A 加服务器层规范化。
执行动作上,可以先在 robots.txt 中限制一组参数路径,然后观察日志中该组路径的请求变化。如果请求下降但目标详情页抓取未上升,说明限制没有把抓取引向正确页面,下一步应检查站内入口是否把权重导向了规范 URL,而不是继续扩大屏蔽范围。请求量归零本身不能证明处理正确,它也可能只是抓取整体下降或日志采集变化,需要结合其他路径的请求量一起看。
保留适用于:页面有独立内容、有外部链接或站内入口、外部层仍有至少一项可改。改写适用于:模板不可动但服务器或网关可配置,且问题集中在状态码、规范化或抓取路径。退出适用于:页面无独立价值、无外部链接、维护成本已经超过收益。
不可逾越的边界是页面内部结构:标题、正文、结构化数据、渲染方式都在模板里,改不了就是改不了。任何声称能在模板之外修正这些内容的方案,都需要先核实其实际作用范围。另外,HTTPS 不保证安全无漏洞或排名,它只解决传输层问题,不要把它当作遗留系统抓取问题的通用解。不同搜索引擎对 robots.txt、站点地图和响应头的支持情况须分别核查,不能按同一套预期执行。
做完外部层调整后,至少核对三类日志字段:请求路径、响应状态码、抓取来源。路径用于确认屏蔽是否生效,状态码用于确认服务器层改动是否按预期返回,来源用于区分是搜索引擎抓取还是其他访问。如果路径请求下降但状态码出现大量非预期值,说明改动影响了正常页面,应优先回退而不是继续推进。
下一步的判断依据是:目标页面抓取是否上升、无价值路径是否下降、错误状态码是否可控。三者中任意一项恶化,都应暂停扩大改动范围,先定位是哪一层动作造成的,再决定保留、改写还是退出。这个顺序比一次性做完所有调整更安全,也更适合无法回滚模板的遗留系统。