PALLM: 使用大型语言模型评估和提升 Palliative Care 对话
计算与语言
2024-09-25 v2 人机交互
摘要
有效的患者-医生沟通对于临床护理至关重要,直接影响患者的结局和生活质量。传统的评估方法,如人类评分、患者反馈和医生自我评估,往往受限于高成本和可扩展性问题。虽然现有的自然语言处理 (NLP) 技术显示出前景,但它们在处理临床沟通的细微差别方面存在挑战,并且需要敏感的临床数据进行训练,这降低了其在实际应用中的有效性。新兴的大型语言模型 (LLM) 提供了一种新的方法,通过整合被动感知和就时干预系统,来评估复杂的沟通度量指标,从而推动该领域的发展。本研究探索了将 LLMs 作为 palliative care 沟通质量的评估器,利用其语言、情境学习和推理能力。具体而言,通过由医疗专业人员精心策划并标记的模拟脚本,我们测试了专有模型(如 GPT-4)和使用由 GPT-4 生成的合成数据集微调的开源 LLMs(如 LLaMA2)来评估临床对话,识别关键度量指标,如“理解”和“共情”。我们的发现表明,LLMs 在评估临床沟通方面表现优异,能够提供具有推理性的可操作反馈,并展示了开发内部 LLMs 的可行性和实际可行性。这项研究凸显了 LLMs 在增强患者-医生互动方面的潜力,为后续在开发受 LLMs 赋能的临床健康系统方面的工作奠定了基础。
引用
@article{arxiv.2409.15188,
title = {PALLM: Evaluating and Enhancing PALLiative Care Conversations with Large Language Models},
author = {Zhiyuan Wang and Fangxu Yuan and Virginia LeBaron and Tabor Flickinger and Laura E. Barnes},
journal= {arXiv preprint arXiv:2409.15188},
year = {2024}
}
备注
Accepted by ACM Transactions on Computing for Healthcare, Special Issue on Large Language Models, Conversational Systems, and Generative AI in Health, pending minor revisions