中文

CureAgent:面向临床推理的无训练执行者-分析师框架

人工智能 2025-12-08 v1

摘要

当前基于小型LLM的临床智能体(如TxAgent)存在“上下文利用失败”问题,即使经过监督微调后成功检索生物医学证据,却无法将诊断依据 grounding 在这些信息上。本文提出了执行者-分析师框架(Executor-Analyst Framework),一种模块化架构,将工具执行的语法精确性与临床推理的语义鲁棒性解耦。通过将专用TxAgent(执行者)与长上下文基础模型(分析师)协调运行,可缓解单一模型中观察到的推理缺陷。除了简单的模块化设计,我们还展示了分层集合策略显著优于全局池化,能够保留证据的多样性,有效解决信息瓶颈。此外,我们的压力测试揭示了关键的规模性洞察:(1)“上下文-性能悖论”,即将推理上下文延伸至12k token 以上会引入噪声,导致准确率下降;(2)工具空间中“维度灾难”,即扩大工具集需要层次化检索策略。关键的是,我们的方法强调了无训练架构工程的潜力,无需昂贵的端到端微调即可实现最新性能,并为下一代可信赖的AI驱动疗法提供了可扩展、敏捷的基础。代码已发布于 https://github.com/June01/CureAgent。

关键词

引用

@article{arxiv.2512.05576,
  title  = {CureAgent: A Training-Free Executor-Analyst Framework for Clinical Reasoning},
  author = {Ting-Ting Xie and Yixin Zhang},
  journal= {arXiv preprint arXiv:2512.05576},
  year   = {2025}
}

备注

2nd Place Solution to the CURE-Bench Competition @ NeurIPS 2025. Code available at https://github.com/June01/CureAgent