中文

Eigen-1:基于监控器的自适应多智能体精炼与检索增强生成用于科学推理

计算与语言 2025-09-26 v1 人工智能

摘要

大型语言模型(LLMs)最近在科学推理方面表现出强大的进步,但仍存在两个主要瓶颈。首先,显式检索会破坏推理过程,带来隐藏的额外标记和步骤的“工具税”。其次,多智能体管道常常通过对所有候选方案进行平均来稀释强大的解决方案。我们提出了一个统一框架,结合隐式检索和结构化协作。在其基础上,一个基于监控器的检索模块在标记级别上运行,将外部知识与推理最小化地集成。该框架之上,层次化解决方案精炼(HSR)不断指定每个候选方案作为锚点,以其同行进行修复;而质量感知迭代推理(QAIR)则根据解决方案的质量进行精炼。在 Humanity's Last Exam(HLE)Bio/Chem Gold 上的测试中,我们的框架达到了 48.3% 的准确率——目前报告的最高水平,超过了最强的代理基线 13.4 分,领先前沿 LLM 最多 18.1 分,同时显著减少了标记使用量(降低 53.5%)和智能体步骤数(降低 43.7%)。在 SuperGPQA 和 TRQA 上的结果也表明该方法在不同领域具有鲁棒性。错误分析显示,推理失败和知识缺口在超过 85% 的情况下是同时发生的;而多样性分析则揭示了清晰的二分法:检索任务受益于解决方案的多样性,而推理任务则偏好共识。综合这些发现,表明隐式增强和结构化精炼如何克服显式工具使用和统一聚合的效率问题。代码已公开:https://github.com/tangxiangru/Eigen-1。

关键词

引用

@article{arxiv.2509.21193,
  title  = {Eigen-1: Adaptive Multi-Agent Refinement with Monitor-Based RAG for Scientific Reasoning},
  author = {Xiangru Tang and Wanghan Xu and Yujie Wang and Zijie Guo and Daniel Shao and Jiapeng Chen and Cixuan Zhang and Ziyi Wang and Lixin Zhang and Guancheng Wan and Wenlong Zhang and Lei Bai and Zhenfei Yin and Philip Torr and Hanrui Wang and Di Jin},
  journal= {arXiv preprint arXiv:2509.21193},
  year   = {2025}
}