当分组后的结论与总体相反,先不要急着推翻分组结论,而应回到分母定义:各分组的分母是否同源、同口径、同时间窗,以及是否包含被总体统计排除的流量。只要分母口径不一致,辛普森式反转就可能只是统计口径造成的假象。
把总体数据和分组数据放在同一张对照表里,逐项核对三件事:分子、分母、时间范围。假设总体显示“品牌词转化率高于非品牌词”,但按设备分组后,手机端却呈现相反方向。此时先判断手机端的分母是否只统计了可识别设备的会话,而总体分母包含了全部会话。若两者分母不同,反转结论不成立。
一个可操作的检查顺序是:先锁定总体结论使用的分母定义,再检查每个分组是否沿用同一分母。如果分组分母被过滤过,例如剔除了未登录用户、内部访问或短时跳出会话,就必须把总体也按相同规则重算一次,再比较方向是否仍然相反。
这三种来源中,过滤条件不对称最容易被忽略,因为它不会报错,只会让分组分母悄悄变小或变大。
不要只看汇总数字,要拉出一条从原始事件到聚合结果的链路。以下是一个假设例子,用于说明比较方法,不代表任何真实项目结果。
假设某站总体跳出率为 60%,按渠道分组后,自然搜索跳出率为 45%,广告渠道为 75%。总体与分组方向看似一致,但若把“直接访问”单独分组,发现其跳出率高达 90%,且直接访问在总体中占比很大,那么总体被直接访问拉高,分组结论与总体并不矛盾。此时要查的是:直接访问的分母是否包含了无法归因的会话,以及这些会话是否被错误地排除在自然搜索分组之外。
具体动作是:导出各分组的原始会话数、去重后会话数、被过滤会话数,三者并列。如果某分组被过滤会话占比明显高于其他组,就应优先检查过滤规则是否对该组有系统性影响。这个动作的结果会直接决定下一步:若过滤规则确实不对称,应统一规则后重算;若规则对称,才需要继续追查分子端的归因逻辑。
如果统一分母后反转消失,原分组结论应被修正为“在特定分母口径下成立”,而不是直接否定。如果统一分母后反转仍然存在,说明反转可能来自真实的构成差异,例如某分组内高转化子类占比更高。此时应继续拆分到下一层,而不是停在分组层面。
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明分母处理正确。归零还可能来自日志采集中断、过滤规则误杀、工具改版或权限变更。只有同时核对采集链路和过滤日志,才能把归零与分母变化区分开。
下一步动作可以固定为:先重算总体与分组的一致分母,再检查过滤规则是否对称,最后才决定是否推翻原结论。这个顺序能避免把口径问题误判为业务问题。