网店收录出现批量问题时,不要逐页排查,而是先按“页面类型+上线批次+入口层级”分层,每层随机抽取固定数量页面,用站内搜索指令和日志交叉核对,把问题范围从几千页缩小到几十页,再决定是模板问题、抓取问题还是内容问题。抽样定位的核心不是找全所有坏页,而是用最小样本判断问题是否集中、集中在哪一层。
抽样前必须统一标准,否则样本之间不可比。对每个抽中的商品页或分类页,依次核对三件事:该 URL 是否被搜索引擎返回结果;返回的是否为店铺自己的目标页面;页面内容是否与线上实际一致。
site: 加完整 URL 查询,同时用页面标题做一次普通搜索比对。site: 无结果但标题能搜到,说明可能是 URL 变体或参数版本被收录,原 URL 本身未进索引,属于规范化问题;若两者都无结果,才计入未收录样本。注意 site: 结果只是近似判断,不同搜索引擎支持程度不同,需要分别核查,不能用一个引擎的结果推断另一个。
网店页面天然分成几类,它们的收录表现差异很大,混在一起抽会互相掩盖问题。
每层建议抽 20 到 30 个 URL。层数多时优先抽商品详情页和分类页,这两类通常是网店流量主体。样本量太小时,单页异常容易被误判为整体问题。
对每个抽中 URL,按下面清单逐项过一遍,每项都要记录结果,方便横向对比。
noindex。模板批量改动时,这里最容易误伤整批页面。把每项结果填进同一张表,横向看哪一项在多数组样本中同时失败。集中失败的项就是优先修复对象,零散失败则按单页处理。
抽样给出假设,日志用来确认。取最近一段时间的服务器访问日志,筛选目标搜索引擎爬虫的请求。
日志与抽样结果不一致时,以日志为准。抽样是概率判断,日志是实际发生过的请求记录。
综合抽样表和日志,通常落到三种结论之一。第一种是抓取层问题,表现为大量样本无抓取记录或返回错误,修复重点是 robots、服务器响应和内链。第二种是索引层问题,表现为被抓取但长期不收录,修复重点是内容差异、canonical 和模板质量。第三种是混合问题,需要先修抓取,再观察索引变化。
修复后不要立刻全站重抽,而是对原样本复检,并追加同层新样本做对照。如果原样本状态改善且新样本表现一致,说明修复生效;如果只有原样本改善,可能是其他因素干扰,需要再观察一轮。
下一步:从后台导出最近一个批次的商品页 URL,按上线时间分成两组,各抽 20 条,先跑一遍上面的七项检查,把结果填进同一张表,再决定先改模板还是先改内链。