MAVEN:基于分步认知审计的多代理验证-细化网络
计算与语言
2026-05-11 v1 人工智能
机器学习
摘要
虽然显式推理轨迹有助于模型可解释性,但现有方法常依赖单一链条,缺乏中间验证环节,导致早期错误不可控地级联。这种缺乏模块化的设计阻碍了细粒度审计,削弱了面向高风险应用所需的认知信任。我们提出MAVEN(Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing),一种受黑板启发的框架,通过显式角色解耦将大语言模型转化为深思熟虑的推理体。其核心机制是对抗性Skeptic-Researcher-Judge循环,模拟专家间的推理,通过功能性分离逻辑防御与事实 grounding。OpenBookQA、TruthfulQA、HALUEVAL和StrategyQA基准测试中的实验表明,MAVEN在四项细粒度指标上均实现了优异的推理质量。值得注意的是,MAVEN在生成显式结构、模块化且可验证的推理轨迹方面,持续优于如GEMINI-3.1-Pro等潜在推理模型以及基于共识的基线方法(如ReConcile),而非依赖隐式内部状态或事后共识。更重要的是,全面评估表明MAVEN完全模型无关,作为强大且可迁移的推理增强器,为多样化的底层模型带来显著性能提升。
引用
@article{arxiv.2605.07646,
title = {MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing},
author = {Yinsheng Yao and Jiehao Tang and Zhaozhen Yang and Dawei Cheng},
journal= {arXiv preprint arXiv:2605.07646},
year = {2026}
}
备注
24 pages, 2 figures