最小修复试验的核心不是“大改一版看效果”,而是把问题拆成可验证的假设,每次只改一个变量,并提前约定观察指标和判定标准。例如怀疑某批页面因模板重复而不被收录,就先只改这一批页面的标题与正文差异,保持URL、内链、服务器状态不变,观察两到四周内百度是否抓取并建立索引。若没有变化,说明该假设不成立,再换下一个变量。
做最小修复试验前,先写清交付物。建议至少包含四项:一份问题清单、一份假设与改动对照表、一份观察记录、一份继续或停止的判断结论。问题清单要写具体现象,例如“某栏目下四十个页面,百度只收录了首页和两篇”,而不是“收录不好”。假设与改动对照表要写清改了什么、没改什么,避免多个变量同时变动。
责任分工也要落到人:谁负责改模板,谁负责提交资源,谁负责记录数据。验收标准要在动手前定好,比如“观察期内新增收录达到五篇”或“抓取频次从每天一次变为每天三次”。没有预先约定的标准,事后容易把任何波动都解释成成功。
百度收录规则涉及抓取、解析、去重、质量判断等多个环节,一次改多项就无法判断是哪一项起了作用。常见假设可以这样拆分:
每次只选一个假设做改动。如果怀疑是抓取问题,就先查服务器日志中百度蜘蛛的访问记录,确认它来过哪些 URL、返回什么状态码;这一步不需要改任何页面。只有确认抓取正常后,才进入解析或质量层面的试验。
假设某站点有三十个商品详情页,百度只收录了其中三个。第一轮试验可以这样安排:
判断结果时要注意:如果试验组新增收录明显多于对照组,说明正文重复是原因之一,可以把改动推广到其余页面;如果两组都没有变化,说明重复不是主要瓶颈,应转向抓取或入口问题。这个例子中的数字是假设,实际分组数量按站点规模调整,但“试验组加对照组”的结构要保持。
试验期间不要同时做这些事:更换服务器、调整全站模板、批量修改内链、大规模删除页面。这些动作会污染观察结果。如果必须做,就在记录中标注日期,并在判断时把该时间段的数据单独看待。
还要区分“可能原因”和“已经定位的原因”。日志显示百度蜘蛛从未访问某目录,只能说明抓取入口可能有问题,不能直接断定是 robots.txt 造成的,需要进一步查看 robots.txt 内容、内链指向和服务器返回码。反过来,如果日志显示蜘蛛频繁抓取但页面始终不收录,问题更可能在解析或质量层面,而不是抓取层面。
另外要记住几条边界:robots.txt 的抓取限制不等于可靠的索引移除,被屏蔽的页面仍可能因外部链接被收录;站点地图不保证收录,它只是发现入口;HTTPS 不保证安全无漏洞,也不保证排名。这些都不能当作试验成功的依据。
可观察的指标包括:百度蜘蛛对目标 URL 的抓取次数、返回状态码分布、页面是否出现在搜索结果中、搜索标题是否与页面标题一致。不要只看“收录数量”一个数字,因为收录本身有延迟和波动。
提前设定停止条件。例如连续观察四周后,试验组与对照组差异不足两篇,就停止该假设,转入下一项。若某项改动导致抓取量明显下降或出现大量错误状态码,应立即回滚,而不是继续等待。每次试验结束后,把结论写进记录:假设是什么、改了什么、观察多久、结果如何、下一步做什么。这样下一轮试验才有依据,不会重复已经排除的方向。
下一步可以从服务器日志中导出最近三十天百度蜘蛛的访问记录,按目录和状态码分组,找出抓取最少的页面类型,作为第一个待验证假设。