先给有条件的结论:试做阶段表现好、批量交付变差,通常不是执行者突然变差,而是试做时的检查强度没有随批量同步放大。此时最有效的抽查不是加大整体抽样比例,而是按“可区分原因”设计三类抽查:时间分布抽查、账号或站点分层抽查、同一任务的前后对照抽查。三者中只要有一类结果与另两类矛盾,就不能用“批量必然掉质量”来解释,需要转向查具体环节。
试做阶段往往只做少量站点或少量内容,检查者会逐条看;批量交付后改成了看汇总表或抽几条。这时“变差”可能只是观察粒度变粗,而不是实际质量下降。可核对的证据是:把试做阶段留存的原始交付物与批量阶段同一类型交付物放在同一张检查表上对照,看扣分项是否集中在同一位置。如果试做时逐条记录、批量时只记总数,那么差异可能来自记录方式,而不是交付本身。
一个反例会让上述判断失效:如果批量阶段连最基础的硬性项(如页面可访问、必填字段齐全)都出现缺失,而试做阶段从未缺失,那么更可能是交付流程被压缩,而不是检查口径问题。此时继续用“观察粒度”解释会掩盖真实缺陷。
把批量交付按提交时间切成三段:前段、中段、后段,每段随机抽同样数量的条目,用同一张检查表打分。如果三段得分接近,说明问题可能来自统一标准或统一模板;如果只有后段明显偏低,更可能是产能爬坡后检查被跳过,或交接环节在后期被省略。
假设某次批量交付共 90 个页面,前中后各抽 10 个,前段 9 个合格、中段 8 个合格、后段 5 个合格。这个分布提示问题集中在后段,下一步动作应是查后段对应的排期与检查记录,而不是全面返工前段。如果三段都低,则优先查标准或模板是否在批量开始时被改动。
批量交付常涉及多个站点或多个执行账号。把交付物按站点或账号分组,每组抽 2 到 3 条,比较组内与组间差异。如果只有某一组明显偏低,问题更可能出在该组的执行或交接;如果所有组都偏低,问题更可能在统一标准、统一工具或统一审核环节。
挑出试做阶段已交付、批量阶段又出现同类任务的条目,做一对一对照。对照时只看可核对项,例如标题是否与主题一致、必填信息是否完整、链接是否指向正确目标。如果同类任务在批量阶段反复缺失同一项,说明该项没有被写入批量检查表;如果缺失项每次不同,说明检查执行不稳定。
这个动作的结果会直接影响下一步:若缺失项固定,优先改检查表并补一次定向复测;若缺失项随机,优先查执行排期和审核记录,而不是改标准。两种情况的处理成本不同,不能混用。
抽查结论要落到可执行动作上。若后段集中偏低且缺失项固定,可要求补交后段并复测同一批条目;若所有组都偏低且硬性项缺失,应暂停新增批量,先统一标准并重做一轮小批量验证;若只有个别组偏低,可只对该组返工,其余组继续。无论哪种,都要保留本次抽查的原始记录,作为下一轮判断是否改善的对照依据。
需要提醒的是,请求量、抓取量或某项统计归零,不能单独证明抽查处理正确,它们也可能来自排期变化、外部波动或统计口径调整。判断改善仍要回到同一检查表下的前后对照结果。