中文

证据收集中的强推理功效性评估

计算与语言 2026-01-28 v1

摘要

交互式医疗咨询需要智能体在不确定性下主动收集遗漏的临床证据。然而,现有的评估方法大多保持静态或以结果为中心,忽略了证据收集过程。本文提出了交互式评估框架,通过模拟患者和模拟记者(基于原子证据)显式建模咨询过程。基于此表征,我们引入信息覆盖率(Information Coverage Rate, ICR)来量化智能体在交互期间完全覆盖必要证据的程度。为支持系统性研究,我们构建EviMed,一个涵盖从常见症状到罕见疾病的证据基准,并评估了10个具有不同推理能力的模型。我们发现,强大的诊断推理并不保证有效的信息收集,而这一不足是限制交互环境中性能的主要瓶颈。为此,我们提出了REFINE策略,利用诊断验证指导智能体主动解决不确定性。大量实验表明,REFINE在各种数据集上 consistently 超越基线方法,促进了有效的模型协作,使较小的智能体能够在强推理监督下实现卓越的性能。我们的代码可在 https://github.com/NanshineLoong/EID-Benchmark 上获得。

关键词

引用

@article{arxiv.2601.19773,
  title  = {Strong Reasoning Isn't Enough: Evaluating Evidence Elicitation in Interactive Diagnosis},
  author = {Zhuohan Long and Zhijie Bao and Zhongyu Wei},
  journal= {arXiv preprint arXiv:2601.19773},
  year   = {2026}
}