临床医生会对此草稿进行多少编辑?评估面向患者消息回复起草的 LLM 对齐
计算与语言
2026-01-19 v1 人工智能
摘要
大语言模型 在起草患者门户网站消息的回复方面展现出潜力,但将其整合到临床工作流程中引发了诸多担忧,包括它们是否真能为临床医生节省处理门户网站工作负荷的时间与精力。我们通过对患者消息回复起草任务的全面评估,研究了 LLM 与个体临床医生的对齐情况。我们开发了一种针对临床医生回复中主题要素的新颖分类法,并提出了一种新颖的评估框架,用于在内容和主题两个层面评估临床医生对 LLM 起草回复的编辑负荷。我们发布了一个专家标注的数据集,并使用包括主题提示、检索增强生成、监督微调和直接偏好优化在内的多种适配技术,对本地和商业 LLM 进行了大规模评估。我们的结果揭示了在将 LLM 草稿与临床医生回复对齐时存在显著的认识不确定性。尽管 LLM 在起草某些主题要素时展现出能力,但在其他主题上难以实现与临床医生对齐的生成,特别是旨在从患者处获取进一步信息的提问。主题驱动的适配策略在大多数主题上产生了改进。我们的发现强调了将 LLM 适配于个体临床医生偏好的必要性,以实现其在患者与临床医生沟通工作流程中可靠且负责任的应用。
引用
@article{arxiv.2601.11344,
title = {How Much Would a Clinician Edit This Draft? Evaluating LLM Alignment for Patient Message Response Drafting},
author = {Parker Seegmiller and Joseph Gatto and Sarah E. Greer and Ganza Belise Isingizwe and Rohan Ray and Timothy E. Burdick and Sarah Masud Preum},
journal= {arXiv preprint arXiv:2601.11344},
year = {2026}
}