中文

通过工具集成强化学习扩展医学推理验证

人工智能 2026-01-29 v1 计算与语言

摘要

大型语言模型在医学推理基准测试中取得了强大的性能,但其在临床应用中需要严格的验证以确保事实准确性。虽然奖励模型提供了可扩展的推理痕迹验证方法,但现有方法存在两个局限:它们仅产生标量奖励值而无明确的依据,以及它们依赖单次检索,阻碍验证过程中灵活的知识获取。我们引入\method\method,一个智能体框架,旨在通过训练医学推理验证器在评估期间迭代查询外部医学语料库来解决这些局限。我们的做法将工具增强的验证与需要仅限痕迹级监督的迭代强化学习范式相结合,同时引入一种自适应课程机制,动态调整训练数据分布。对于四个医学推理基准测试,\method\method在特定情况下相对于基线生成器实现了显著的提升,MedQA准确率提高了23.5%,MedXpertQA提高了32.0%。关键的是,\method\method相对于先前奖励模型基线实现了约8×8\times的抽样预算减少。这些发现表明,将验证 grounding 在动态检索证据方面为更可靠的医学推理系统提供了原则性路径。

关键词

引用

@article{arxiv.2601.20221,
  title  = {Scaling Medical Reasoning Verification via Tool-Integrated Reinforcement Learning},
  author = {Hang Zhang and Ruheng Wang and Yuelyu Ji and Mingu Kwak and Xizhi Wu and Chenyu Li and Li Zhang and Wenqi Shi and Yifan Peng and Yanshan Wang},
  journal= {arXiv preprint arXiv:2601.20221},
  year   = {2026}
}