中文

MedAI:在 NeurIPS CURE-Bench 竞赛中评估 TxAgent 的治疗智能体推理

人工智能 2025-12-15 v1 机器学习

摘要

临床医学中的治疗决策构成了一个高风险领域,其中 AI 指导涉及患者特征、疾病过程与药物之间复杂的交互作用。药物推荐、治疗规划和不良反应预测等任务需要基于可靠生物医学知识的稳健多步推理。以 TxAgent 为代表的 Agentic AI 方法通过迭代检索增强生成(RAG)应对这些挑战。TxAgent 采用微调的 Llama-3.1-8B 模型,动态生成并执行对统一生物医学工具套件的函数调用,整合 FDA Drug API、OpenTargets 和 Monarch 资源以确保获取当前的治疗信息。与通用 RAG 系统不同,医疗应用施加了严格的安全约束,使得推理轨迹和工具调用序列的准确性均至关重要。这些考虑促使评估协议将 token 级别推理和工具使用行为作为显式监督信号。本工作介绍了我们参与 CURE-Bench NeurIPS 2025 挑战赛所获得的见解,该挑战赛使用评估正确性、工具利用率和推理质量的指标对治疗推理系统进行基准测试。我们分析了函数(工具)调用的检索质量如何影响模型整体性能,并展示了通过改进工具检索策略所取得的性能提升。我们的工作被授予开放科学卓越奖。完整信息可参见 https://curebench.ai/。

关键词

引用

@article{arxiv.2512.11682,
  title  = {MedAI: Evaluating TxAgent's Therapeutic Agentic Reasoning in the NeurIPS CURE-Bench Competition},
  author = {Tim Cofala and Christian Kalfar and Jingge Xiao and Johanna Schrader and Michelle Tang and Wolfgang Nejdl},
  journal= {arXiv preprint arXiv:2512.11682},
  year   = {2025}
}

备注

7 pages, 3 figures