同一套网站被挂马检测工具的告警记录,安全团队说“搜索渠道的挂马风险已经收敛”,增长团队却拿出另一张图说“搜索带来的异常访问还在涨”。两边都没改数据,分歧往往出在归因窗口:一边按告警首次出现的时间归因,一边按用户实际触发的时间归因。窗口不同,同一批被挂马页面会被算进不同的渠道和时间段,结论自然对不上。
不要急着争论谁的图对。先做一件事:把两个结论各自的分子和分母拆开,看它们分别来自哪个数据源、覆盖哪段时间、以什么事件作为归因起点。常见情况是,一方用的是检测工具扫描发现的挂马页面清单,另一方用的是站内统计里被篡改页面产生的异常跳转。这两者的口径本来就不同,窗口只是放大了差异。
能区分两种解释的证据很具体:如果只是窗口不同,那么把两边的统计区间对齐到同一段起止时间后,差异应明显缩小;如果对齐后差异依旧,说明问题出在数据源覆盖范围或事件定义上,而不是窗口长度。这一步的动作是“对齐区间重算”,它的结果直接决定下一步该讨论窗口设置,还是该讨论采集口径。
按告警首次出现归因,适合判断“处理动作是否生效”。它关心的是挂马从被发现那一刻起,是否被清理、是否复发,窗口通常较短,以小时或天为单位。
按用户实际触发归因,适合判断“影响面有多大”。一个被挂马的页面可能在几天后才被大量访问,或被搜索引擎重新抓取后才暴露,窗口会被拉长。它的前提是:你关心的是暴露给用户的规模,而不是清理动作的快慢。
两者都成立,只是回答的问题不同。把这两个前提写进同一份记录,比争论哪个窗口“更准”更有用。
与其让两个角色各说各话,不如把争议落成一张可核对的清单:
每一项都要求给出可复查的原始记录。核对时优先看归因起点和事件定义,这两项最容易造成数量级差异。窗口长度的影响通常排在它们之后。
假设某页面在周一被检测工具标记为挂马,周三才被大量用户访问。按告警时间归因的统计会把风险记在周一,按用户触发归因的统计会记在周三。如果两方各自只报“本周风险上升”,就会得出相反的走势。此时正确动作不是调窗口去凑一个好看的曲线,而是标注清楚每个数字的归因起点,再看它是否支持当前要做的决定。
窗口不是用来消除分歧的工具,而是用来暴露“我们在回答不同问题”的镜子。先把问题对齐,再谈窗口长短,渠道效果的判断才不会互相打架。