先把“被发现”与“被收录”分开:批量页面里只有一部分出现在抓取或索引结果中,通常不是全站开关失灵,而是某组页面共享的条件不同。划分对照组的目的,是让保留、改写或退出这三个动作各自有可比较的基线,而不是拿一个成功页面去证明所有相似页面都会成功。
批量页面只有一部分被发现时,最省事的做法是从列表里随机抽几十条逐页检查。这个做法在样本量小时容易误导,因为“被发现”的差异往往来自模板、目录层级、内链位置、发布时间或参数结构,而不是单页正文质量。更稳的起点是把页面按共享条件切成若干组:同一模板生成的列表页、同一批导入的商品页、同一目录下的分页、同一时间上线的落地页。每组内部条件接近,组与组之间才有对照意义。
如果某组里被发现的比例明显高于另一组,先不要下结论说“这组模板更好”。还要检查两组是否在抓取入口上不同,例如一组能从首页两三跳到达,另一组只能靠站点地图或站内搜索进入。入口差异本身就能解释发现率差异,此时改写正文不会改变结果。
保留一个组,意味着暂时不动它的模板、链接结构和内容,把它当作后续比较的基线。适用前提是:这组页面确实有稳定抓取入口,且入口不依赖临时活动页、短期推荐位或外部链接。如果入口本身会随运营排期消失,它就不是可靠的保留组,而只是恰好被看到的样本。
保留组的实际动作是记录它的入口路径和页面状态,然后观察新增同类页面是否也能沿同一路径被发现。如果新增页面重复出现“老页面被发现、新页面没被发现”,说明问题更可能出在新增页面的进入方式,而不是老页面的内容质量。这个结果会直接影响下一步:先修入口,而不是先改正文。
改写适用于一种情况:同一组页面在入口条件接近时,仍只有一部分被发现,且差异集中在标题、首屏可见内容或结构化数据上。此时可以从组内挑出条件最接近的页面,只改一个维度,例如只调整标题与首段是否直接回应查询意图,其他模板、内链、发布时间保持不变。
假设有二十个同模板页面,其中八个被发现、十二个没有。若把十二个未发现页面全部同时改标题、改正文、加内链、换图片,即使之后发现率上升,也无法判断是哪一项起作用。更合理的做法是拆成两个小组:一组只改标题与首段,另一组保持原样作为对照。这个比较只说明该组在当前入口条件下的变化,不能直接推广到其他模板或另一批导入页面。
改写组的结果若显示“改标题与首段后被发现比例没有变化”,下一步应转向入口和内链,而不是继续堆正文。若显示有变化,也要先确认变化是否只出现在有独立内链的页面上;若是,真正起作用的可能是内链,而不是文字本身。
退出适用于一类页面:它们既没有独立搜索需求,也没有稳定内链入口,仅靠批量生成或参数组合存在。对这类页面继续改写,通常只是增加维护成本。退出的实际动作可以是不再新增同类页面、从站点地图中移除、取消内链推荐,或把它们合并到有入口的父页面。
这里要区分抓取限制与索引移除。用 robots.txt 挡住抓取,并不等于可靠地从索引中移除已有页面;它可能只是阻止后续抓取,已收录结果仍可能保留一段时间。站点地图也不是收录保证,它只是提交候选入口。因此退出组的判断依据应是“这组页面是否值得继续保留入口”,而不是“挡掉抓取就结束了”。
可操作的做法是:先按共享条件分出三组,每组至少包含已发现和未发现页面;保留组不动,改写组只改一个变量,退出组停止新增并观察入口变化。一轮之后看的是组间差异是否稳定,而不是单个页面是否被收录。若差异只出现在有独立内链的组,下一步优先补入口;若差异出现在同入口、同模板但内容意图不同的组,下一步才考虑改写;若两组在同入口下都没有变化,退出比继续改写更合理。
这套划分不能照搬到所有批量场景。页面数量很少、入口高度集中或整站刚上线时,组间差异可能只是时间差,此时保留观察比立即改写更合适。只有当同一组内已发现与未发现页面共享入口、模板和发布时间,对照才真正成立。