可信医学问答:以评估为中心的综述
计算与语言
2025-11-04 v2
摘要
医疗问答(QA)系统中的可信性对于确保患者安全、临床有效性和用户信心至关重要。随着大语言模型(LLMs)越来越多地集成到医疗环境中,其回答的可靠性直接影响临床决策和患者结果。然而,在医学QA中实现全面的可信性面临重大挑战,这源于医疗数据的内在复杂性、临床场景的关键性质以及可信AI的多维特性。在本综述中,我们系统地审视了医学QA中可信性的六个关键维度,即事实性、鲁棒性、公平性、安全性、可解释性和校准。我们回顾了每个维度在现有基于LLM的医学QA系统中是如何被评估的。我们汇编并比较了用于评估这些维度的大规模基准,并分析了驱动模型改进的评估引导技术,如检索增强锚定、对抗微调和安全对齐。最后,我们识别了开放挑战——如可扩展的专家评估、集成多维指标和真实部署研究——并提出了未来研究方向,以推进LLM驱动的医学QA的安全、可靠和透明部署。
引用
@article{arxiv.2506.03659,
title = {Trustworthy Medical Question Answering: An Evaluation-Centric Survey},
author = {Yinuo Wang and Baiyang Wang and Robert E. Mercer and Frank Rudzicz and Sudipta Singha Roy and Pengjie Ren and Zhumin Chen and Xindi Wang},
journal= {arXiv preprint arXiv:2506.03659},
year = {2025}
}
备注
accepted to EMNLP 2025