ACAR:基于可审计决策轨迹的自适应复杂度路由用于多模型集成
摘要
我们提出ACAR(Adaptive Complexity and Attribution Routing),一种用于研究在可审计条件下进行的多模型编排的测量框架。ACAR使用从 N=3 个探测样本计算的自洽方差(sigma)来在单模型、双模型和三模型执行模式之间路由任务。该系统在TEAMLLM之上实现,后者是一个具有不可变工件和完整决策轨迹的确定性执行子系统。我们在1,510个任务上评估了ACAR,涵盖四个基准:MathArena、Reasoning Gym、LiveCodeBench 和 SuperGPQA,使用 Claude Sonnet 4、GPT-4o 和 Gemini 2.0 Flash,产生了超过7,550次可审计运行。结果表明,基于sigma的路由实现了55.6%的准确率,超过双模型基线的54.4%,同时在54.2%的任务上避免了完整集成。该路由机制是模型无关的,无需学习组件。我们也记录了负面结果。首先,检索增强将准确率降低了3.4个百分点,因为中位数检索相似度仅为0.167,表明在没有语义对齐的情况下将经验注入会引入噪声而非 grounding。其次,当模型在错误答案上达成一致时(sigma等于零),任何下游集成都无法恢复;这种一致却错误的失败模式是自洽性固有的,使可实现准确率在大约低于完整集成约8个百分点。第三,基于代理信号(如响应相似性和熵)的归因估计与真实 leave-one-out 值之间的相关性很弱,表明实际归因需要显式的反事实计算。本工作记录了实践中哪些假设失效,并为未来研究在路由、检索和多模型归因方面提供了可检验的基线。
引用
@article{arxiv.2602.21231,
title = {ACAR: Adaptive Complexity Routing for Multi-Model Ensembles with Auditable Decision Traces},
author = {Ramchand Kumaresan},
journal= {arXiv preprint arXiv:2602.21231},
year = {2026}
}
备注
12 pages, 9 figures. Measurement framework for adaptive multi-model routing with auditable execution traces