中文

CARE-RAG - 临床评估与推理

人工智能 2025-11-21 v1 计算与语言

摘要

获取正确证据并不保证大语言模型(LLMs)会正确地对其进行推理。在临床环境中,这尤为concerning,因为输出必须与结构化协议一致。我们以 Written Exposure Therapy(WET)指南为 testbed 来研究这一差距。在评估针对精心挑选的临床医生审核问题的模型响应时,我们发现即使提供权威段落,错误仍然存在。为此,我们提出了衡量推理准确性、一致性和忠实度的评估框架。我们的结果突显了潜力与风险:检索增强生成(RAG)可以约束输出,但安全部署需要对推理进行严格评估,方式与检索一样。

关键词

引用

@article{arxiv.2511.15994,
  title  = {CARE-RAG - Clinical Assessment and Reasoning in RAG},
  author = {Deepthi Potluri and Aby Mammen Mathew and Jeffrey B DeWitt and Alexander L. Rasgon and Yide Hao and Junyuan Hong and Ying Ding},
  journal= {arXiv preprint arXiv:2511.15994},
  year   = {2025}
}

备注

The Second Workshop on GenAI for Health: Potential, Trust, and Policy Compliance