中文

评估生成式人工智能驱动医疗对话有效性的基础指标

计算与语言 2024-03-01 v3

摘要

生成式人工智能有望通过将传统患者护理转变为更个性化、高效和主动的过程来彻底改变医疗服务。聊天机器人作为交互式对话模型,很可能推动医疗领域这一以患者为中心的转型。通过提供包括诊断、个性化生活方式建议和心理健康支持在内的多种服务,其目标是在大幅减轻医疗提供者工作负担的同时,显著改善患者健康结果。医疗应用关乎生命的关键性质,有必要为对话模型建立一套统一且全面的评估指标。现有针对各种通用大语言模型(LLM)提出的评估指标缺乏对医疗和健康概念及其在促进患者福祉方面重要性的理解。此外,这些指标忽视了建立信任、伦理、个性化、共情、用户理解和情感支持等关键的用户中心维度。本文旨在探索最先进的基于LLM的评估指标,这些指标特别适用于医疗中交互式对话模型的评估。随后,我们提出一套全面的评估指标,旨在从终端用户视角彻底评估医疗聊天机器人的性能。这些指标涵盖语言处理能力、对真实世界临床任务的影响以及用户交互对话中的有效性评估。最后,我们讨论了定义和实施这些指标相关的挑战,特别强调了混淆因素,如评估过程中涉及的目标受众、评估方法和提示技术。

关键词

引用

@article{arxiv.2309.12444,
  title  = {Foundation Metrics for Evaluating Effectiveness of Healthcare Conversations Powered by Generative AI},
  author = {Mahyar Abbasian and Elahe Khatibi and Iman Azimi and David Oniani and Zahra Shakeri Hossein Abad and Alexander Thieme and Ram Sriram and Zhongqi Yang and Yanshan Wang and Bryant Lin and Olivier Gevaert and Li-Jia Li and Ramesh Jain and Amir M. Rahmani},
  journal= {arXiv preprint arXiv:2309.12444},
  year   = {2024}
}

备注

14 pages, 4 figures, 2 tables, journal paper