MARINE:多智能体递归IN-context增强的理论优化与设计
物理与社会
2025-12-10 v1
摘要
基于大型语言模型(LLM)的智能体表现出先进的推理能力,但实际限制常常使输出局限于单个响应,留下了大量潜在性能未被实现。本文引入MARINE(Multi-Agent Recursive IN-context Enhancement),一个在本质上将测试时推理重新概念化为持久参考轨迹的迭代细化框架,基本上偏离了传统的单次或多采样范式。MARINE细化算子系统atically将基础模型的pass@N能力转化为接近最优的pass@1性能。严格的理论分析表明,最小可行batch大小在固定调用预算下可最大化预期性能提升,而 logarithmically growing batch schedule确保了在无计算限制的情况下持续改进。针对BrowserComp-ZH基准进行了全面评估,表明685B参数实现的MARINE达到了46.0%的pass@1准确率。与此同时,MARINE建立了一种新的参数效率推理范式:一个80B参数模型配合MARINE即可匹配独立1000B参数智能体的性能,将参数需求降低了一个数量级。值得注意的是,在固定计算预算下,本文提出的MARINE比传统的抽样与排序策略为对齐和优化过程提供了更高质量的样本。因此,它有巨大的潜力来提高后训练效率。
引用
@article{arxiv.2512.07897,
title = {Analysis of the Sybil defense of Duniter-based cryptocurrencies},
author = {Lucas Isenmann},
journal= {arXiv preprint arXiv:2512.07897},
year = {2025}
}