中文

CADMAS-CTX:多主体委派情境能力校准

人工智能 2026-04-21 v1

摘要

我们重新审视多主体委派问题,假设主体能力并非固定于技能层级,而是取决于任务情境。一个编码主体可能在短期独立编辑中表现出色,却在长期调试中失败;一个规划主体可能在浅层任务中表现良好,却在链式依赖任务中性能下降。静态的技能层级能力轮廓因此会对异构情境进行平均,可能导致系统性的误委派。我们提出了CADMAS-CTX框架,用于情境能力校准。对于每个主体、每个技能和每个粗糙情境区间,CADMAS-CTX维护一个Beta后验分布,以捕捉该任务空间中稳定经验。委派过程通过一个风险感知评分完成,该评分结合后验均值与不确定性惩罚,确保只有当同伴显然更优且评估受到充分证据支持时才进行委派。本文作出三项贡献:首先,用层次化情境能力轮廓取代静态技能层级置信度,引入情境条件化后验;其次,基于情境式bandit理论,形式证明在情境异质性充足时,情境感知路由相对于静态路由可实现更低的累积后悔,正式化了偏差-方差权衡;第三,我们在GAIA和SWE-bench基准上进行经验验证。在GAIA基准上使用GPT-4o主体,CADMAS-CTX实现了0.442的准确率,显著优于静态基线0.381和AutoGen 0.354,且具有非重叠的95%置信区间。在SWE-bench Lite上,将解决率提升至31.4%。消融实验表明,不确定性惩罚可提高对情境标记噪声的鲁棒性。我们的结果表明,情境校准和风险感知委派显著优于静态全局技能分配,显著提升了多主体团队协作效果。

关键词

引用

@article{arxiv.2604.17950,
  title  = {CADMAS-CTX: Contextual Capability Calibration for Multi-Agent Delegation},
  author = {Chuhan Qiao},
  journal= {arXiv preprint arXiv:2604.17950},
  year   = {2026}
}