先给结论:批量页面收录异常时,不要逐条重提交,而应按“模板—目录—单页”三层抽样,先确认问题集中在哪一层,再决定优先修哪一批。抽样目标不是找出一两个坏页面,而是用最少样本判断故障边界,把有限人力压到影响面最大的那一层。
抽样定位适用于页面成批产生、结构相似、由同一套模板或同一批数据生成的站点,例如商品页、文章页、城市分站页。若全站只有几十个页面,或每个页面结构差异极大,直接逐页核查反而更快。
抽样前要先排除两类干扰:一是robots.txt 的抓取限制不等于可靠的索引移除,被限制抓取只说明爬虫可能不来,不代表页面一定被删除或不被收录;二是站点地图不保证收录,提交 sitemap 只是告知存在,不是收录承诺。把这两件事当成“已解决”,会让抽样结论失真。
按下面顺序抽,每层抽 5 到 10 个样本即可,不必追求统计显著,目的是快速定位边界。
每层记录同一组字段:页面能否直接访问、返回状态码、是否有唯一标题、正文是否可读、是否有站内入口链接。字段统一,才能横向比较。
抽样时逐项核对,并按结果分流:
200 但正文为空或需脚本加载:先查渲染与数据接口,不要急着改内容。404 或 5xx:属于可访问性问题,优先级高于内容优化。这里要区分“可能原因”和“已经定位的原因”。例如同一目录多页不收录,可能是入口太深,也可能是内容重复或抓取预算分配,不能凭一个现象就断定为唯一原因。抽样只是缩小范围,最终结论要靠对比样本间的差异得出。
这套方法适合时间和人手有限、需要排优先级的情况。若站点刚上线、样本量太少,或近期做过大规模改版,抽样结论可能不稳定,应结合改版时间线一起看。
验收信号分两步看:短期看抽样层内异常比例是否下降,例如原目录 10 个样本中 7 个异常,修复后降到 2 个;中期看该层页面的抓取和展现是否逐步恢复。恢复速度受站点规模、更新频率和内容质量影响,没有固定见效时间,也不应承诺具体收录数量。
下一步:选一个异常最集中的模板或目录,按上面三层各抽 5 个页面,填好同一组检查字段,先修影响面最大的那一层,再复抽验证。