能不能连接,取决于新旧数据源是否共享同一套标识、同一统计口径和同一时间粒度。如果这三点对得上,历史曲线可以拼接;只要有一项对不上,拼接出来的曲线就是误导,正确做法是分段展示并标注断点。
把历史曲线拆开看,它通常由三层构成:对象标识(这条线代表哪个页面、哪个查询、哪个域名)、指标口径(展示、点击、排位、可见度各自怎么算)、时间粒度(按天、按周还是按采样点)。换数据源时,三层都一致才叫可连接。
一个常见误判是只看总量是否接近。总量接近不代表曲线可连接,因为总量可能是正负偏差互相抵消的结果。真正要核对的是同一批对象在新旧源里的取值差异方向是否一致。
当确认三层一致,动作顺序是:先冻结旧源最后一段数据,再用新源回采一段重叠期,用重叠期验证偏差,最后才拼接。
这个动作的结果会直接影响下一步:如果重叠期偏差稳定,后续所有对比都可以沿用同一条曲线;如果偏差随对象类型而变,就不能整体拼接,要按对象分组决定哪些可以接、哪些必须断开。
口径不一致的典型信号有三个:同一页面的排位在新源里整体平移、长尾查询数量突然增减、按天的波动被抹平成按周。出现任一信号,都说明新旧源在定义层面不同。
此时的处理不是修复曲线,而是分段展示:旧段保留原口径,新段用新口径,中间留一个明确标注的断点。这样做的好处是,读者能看出变化来自数据源切换而不是真实表现波动。
假设一个用于说明方法的例子:某站点旧源按天记录排位,新源按周取中位数。若直接把周值插进日序列,曲线会显得更平滑,看起来像排名变稳了,但真实情况可能只是采样变粗。这个例子里,正确动作是保留日序列到断点,之后单独用周序列,并在图上注明粒度变化。数字仅用于说明比较方法,不代表任何真实项目结果。
换数据源往往伴随旧系统或旧合作关系退出。此时不必全盘丢弃,可以按用途分层保留:
例外情况是,如果旧源本身存在已知的系统性偏差,且新源已修正,那么保留旧曲线时要同时保留偏差说明,否则断点前的数据会被误读为真实水平。
动手前,先确认四件事:新旧源的对象标识是否可映射、指标定义文档是否可得、重叠期数据是否可回采、断点在报表中如何呈现。这四项里任何一项无法确认,都应先按不可连接处理。
如果涉及具体品牌工具,其当前是否支持历史数据导入、回采范围多大、断点标注如何呈现,属于会随版本变化的细节,需要以该工具当时的官方说明为准,不要依据旧教程或第三方描述推断。
最后提醒一点:切换后请求量、抓取量或某项统计归零,并不能单独证明切换成功或失败。归零也可能来自采集延迟、权限变化或对象映射缺失。判断依据应当是重叠期的逐对象比对结果,而不是单一指标的突变。