开群机器人|QQ群机器人|微信群机器人|三公机器人

QQ群机器人 VeriHarness 拆解:多数投票为何会掩盖错误

VeriHarness 拆解:多数投票为何会掩盖错误


VeriHarness是谷歌云AI与剑桥大学团队2026年10月发布的长 horizon Agent 验证框架,核心结论直接推翻了“多数投票/自一致性是可靠验证手段”的行业直觉:‌长任务场景下,34%的全票共识主张本身就是错误的,多数投票不仅无法纠错,反而会把所有Agent共同犯下的系统性错误完全掩盖‌。


📊 核心实验发现


团队用Claude Opus 4.8在APEX-Agents基准上,对每题生成10条独立rollout轨迹,做了主张级的全量统计,结果完全反常识:


全票共识样本‌:917条所有rollout完全一致的主张中,有‌34%‌最终被标准rubric判定为错误,所有Agent达成了“集体犯错”的共识。

存在分歧样本‌:775条不同rollout结果不一致的主张中,有‌74%‌至少包含一个正确答案;而出现频率最高的多数派结果,正确率仅为47%。


这直接打脸两个行业常见错误认知:


多数投票默认“少数服从多数”,但在长任务场景下,多数派的正确率甚至低于随机选择。

过去大家默认“分歧是噪音”,但实际上分歧恰恰是暴露正确答案的关键信号,而非需要过滤的无效信息。

🔍 多数投票掩盖错误的三类核心机制

1. 同源系统性错误


所有rollout使用同一个基础大模型,模型本身的知识盲区、推理缺陷、幻觉模式是完全共享的:比如所有Agent都引用了同一条过时的数据源、所有Agent都犯了同一个单位换算错误、所有Agent都漏掉了同一个隐藏的边界条件,这种同源错误会在每一次rollout中复现,最终形成全票共识,多数投票会直接把这个错误判定为“绝对可信”,完全无法识别。


2. 同家族模型的关联错误


即使换用多个不同模型做投票,只要这些模型属于同一家族(比如都是Qwen2.5系列的不同变体),它们的训练数据、推理路径高度相似,会在同一类误导性问题上集体出错。实验中在“误导性难题”分层测试集上,标准多数投票的正确率直接降到0%,少数派中唯一正确的答案被完全淹没在关联错误的多数派中。


3. 长任务下的错误同步放大


短问答场景下多数投票效果尚可,但长horizon任务中,错误会在多步执行中同步扩散:所有Agent在第一步都选了同一个错误的分支,后续所有步骤的结果都会同步偏离正确路径,最终所有rollout的最终产物高度相似,错误完全同步,多数投票自然无法识别出问题。


🛠️ VeriHarness的破局思路


VeriHarness没有沿用多数投票的思路,而是把验证本身做成了一个独立的Agent,直接绕开“统计多数”的陷阱:


分歧解决器‌:不直接选多数派结果,先定位所有rollout的争议点,把每个候选值追溯到对应的执行轨迹、来源文件、计算过程,允许“所有候选都可能错”,通过交叉取证选出最有证据支撑的结果。

共识挑战器‌:专门针对全票共识的结果,主动提出“这个结论可能哪里错了”的反事实假设,去环境中主动搜索所有rollout集体漏掉的需求、被所有人忽略的异常点,主动挑战看似无懈可击的共识。

全量取证权限‌:验证器和生成器拥有完全对等的工具与环境访问权,不是只读最终产物打分,而是可以追溯来源、重算数值、执行代码、检查元数据,用环境中的客观证据替代“模型之间互相投票”的主观判断。

✅ 工程落地启示

多数投票只适合短问答、简单分类这类低复杂度场景,长horizon的Agent任务里,“多跑几遍取多数”的方案本质上是把共享错误原样固化,完全不可靠。

验证的核心不能靠模型之间互相投票,必须把“环境中的客观证据”作为判定核心,验证器必须拥有和生成器同等的工具操作权限,否则只是在批改一份自己没法核对的答卷。

分歧不是噪音,是最有价值的信号:当多个Agent结果不一致时,恰恰说明这个点存在高概率的错误风险,需要优先做交叉验证,而不是直接用多数投票抹平差异。


需要我为你整理一份VeriHarness的最简可运行实现代码吗?包含分歧解决器和共识挑战器的核心逻辑,直接替换掉你现有系统里的多数投票模块即可。


admin
admin
这个人很神秘

发布评论