先把“被发现”拆成两个可观测节点:搜狗是否抓取过该 URL,以及抓取后是否进入可检索的索引。批量页面只被收录一部分时,不要急着全量重提,先按页面类型、内部链接层级和内容差异划分对照组,用未收录页面与已收录页面做同条件比较。若两组之间只有“是否手动提交”这一项不同,才值得保留提交动作继续观察;若差异同时出现在模板、入口链接和内容重复度上,提交本身很可能不是主因,应改写或退出这批页面的提交策略。
对照组要能回答“哪一类页面没被发现”,而不是笼统统计收录比例。可用的划分维度包括:页面是否在站点主导航或列表页有稳定入口、是否由同一模板生成、正文是否由同一批数据派生、URL 是否带参数、上次内容更新时间是否接近。维度一次只取一个,否则无法判断差异来自哪里。
假设有 500 个商品页,其中 80 个被搜狗发现,420 个没有。若按“是否有站内搜索入口”分组,发现被发现的 80 个大多来自分类列表页,未发现的 420 个只能通过站内搜索到达,那么优先检查的是内部链接路径,而不是重复提交。这个假设只说明比较方法:先找两组之间最稳定的差异,再决定下一步动作。
保留提交并继续观察,适合以下条件同时成立:未收录组与已收录组在模板、正文、入口层级上基本一致;服务器对搜狗抓取没有持续返回异常状态;站点地图中的 URL 与实际可访问地址一致。此时可以把未收录页面按同一批次重新提交,并在后续抓取日志中核对是否出现新的抓取记录。
实际动作是:从 420 个未收录页面中抽 30 个作为提交组,另抽 30 个作为不提交的对照组,两组来自同一模板和同一入口层级。几天后比较两组的抓取记录变化。如果提交组出现抓取而对照组没有,说明提交动作可能起了推动作用;如果两组都没有变化,提交就不是当前瓶颈,继续扩大提交量只会增加维护成本。
当两组差异集中在内容层面时,提交动作应让位于改写。典型信号是:已收录页面有独立参数或独立描述,未收录页面正文高度相似,仅价格或库存数字不同;或者未收录页面标题由模板批量拼接,缺少可区分的主题。此时改写应针对可验证的差异,而不是全站换标题。
可执行的做法是:挑 20 个未收录页面,补充独有的规格说明、适用场景或常见问题,保留原有 URL 不变;另选 20 个相似页面不做内容改动,作为对照。之后观察两组在抓取和索引上的变化。若改写组出现新的抓取,且抓取后进入索引,说明内容区分度是有效变量;若只有抓取没有索引,问题可能仍在页面质量或站点整体信任度,需要继续排查,而不是重复改写同一批页面。
退出不是放弃整站,而是停止对某一类页面继续投入提交资源。适用条件包括:该类页面本身属于筛选结果页、分页过深或参数组合页,业务上并不需要全部被检索;或者页面内容由外部数据实时拼装,无法稳定提供独立价值。此时继续提交只会让抓取预算消耗在低价值 URL 上。
动作与结果的关系要写清楚:把这类 URL 从站点地图和内部推荐入口中移出,观察搜狗后续抓取是否更多转向真正需要收录的页面。若抓取记录确实向核心页面集中,说明退出策略成立;若核心页面抓取没有变化,则说明原有限制不在这些低价值 URL 上,应回到服务器响应和入口结构继续排查。
判断时不要只看“提交了多少”或“收录了多少”。更有区分度的证据是:同一批 URL 中,抓取记录是否出现、抓取时返回的状态码是否稳定、页面正文是否在抓取前后发生变化、内部链接是否在多个入口重复出现。请求量或抓取量下降,也可能来自站点整体抓取频率调整、服务器响应变慢或入口链接被移除,不能单独证明某次提交处理正确。
把结论落成一个可复核的决策:如果对照组差异指向入口和抓取路径,先修内部链接并保留少量提交样本;如果差异指向内容重复,先改写再观察;如果该类页面本就不需要被检索,退出提交并收紧入口。每一步都保留未处理对照组,才能在下一次判断时知道变化来自哪里。