被删除页面的数据能否继续参与历史对比,取决于你保留的是“页面级快照”还是“站点级汇总”。只保留汇总时,删除页面会从总量中消失,后续对比必然断层;保留逐页快照时,删除页面仍可作为历史基线,但必须接受它不再有新增数据这一事实。两种做法都成立,区别在于你要回答的是“站点整体趋势”还是“某个页面的生命周期”。
做小规模验证时,常见做法是把删除页面的历史数据并入“其他”分类,总量看起来仍然连续。样本只有几十个页面时,这种合并几乎不产生可见偏差;页面数量上升后,被删除页面在“其他”里的占比变大,任何按目录、按模板、按内容类型的对比都会被这个混合桶污染。此时你看到的“某目录流量下滑”,可能只是该目录下若干页面被删除后归入了别的分类。
这不是数据本身出错,而是分类口径在删除动作发生后没有同步更新。要判断问题出在哪,先要区分两种解释。
如果删除页面被并入兜底分类,站点总量可以保持连续,但所有依赖分类的对比都会失真。可区分的证据是:兜底分类的占比在删除时间点前后出现台阶式抬升,而各原始分类的降幅之和大致等于兜底分类的增幅。这种情况下,总量曲线平滑并不能说明处理正确,只能说明你把结构变化藏进了一个不透明的桶里。
实际动作:把兜底分类拆开,按“已删除页面”单独建一个标签,而不是混入“其他”。这样做的结果是,后续任何按分类的对比都能明确排除已删除页面,或者显式把它们计入,选择权回到你手里,而不是被默认口径替你做决定。
另一种情况是恢复或重建过程中,旧页面的历史指标被新页面的数据覆盖,导致删除前的基线不可追溯。可区分的证据是:同一页面标识在删除时间点前后的记录出现断裂或跳变,且断裂处没有对应的删除标记。这与解释一的区别在于,解释一里历史数据还在、只是归错了类;解释二里历史数据已经不完整。
如果确认是覆盖,那么任何“删除前后对比”都失去意义,因为对比的一端已经不存在。此时应优先从备份或只读存档中取回删除前的页面级记录,而不是继续在现有数据上做推断。
按下面的顺序核查,可以避免把口径问题和数据丢失问题混为一谈:
假设某站点有 500 个内容页,其中 20 个被删除后并入“其他”。删除前“其他”占总量的 3%,删除后升到 9%。如果只看总量,曲线几乎不动;但如果按目录对比,被删除页面所属目录会显示下滑,而“其他”显示上升。此时正确做法不是调整总量,而是把这 20 个页面单独标记,让目录对比恢复可比性。这个例子只说明比较方法,不构成对任何真实站点的推断。
如果删除页面数量极少、且站点决策只依赖总量趋势,那么保留汇总即可,逐页快照的维护成本可能高于收益。反过来,只要站点需要按目录、模板或内容类型做对比,或者删除动作集中发生在某一类页面上,就必须保留页面级历史记录并显式标记删除状态。判断标准不是数据量大小,而是你的对比维度是否会被删除动作穿透。
最后需要提醒:第三方估算流量、搜索引擎报告与站内统计的口径本就不同,删除页面在其中一方的记录消失,不代表其他来源也同步归零。把不同来源的删除前后数据直接相减,得到的差值既可能来自删除,也可能来自口径差异,不能单独作为判断依据。