问诊清单:标准化医疗病历生成的人工评估
计算与语言
2022-11-18 v1
摘要
由于输出质量诸多方面固有的主观性,自动生成文本的评估通常较为困难。在自动问诊病历生成中,医学专家之间对于哪些患者陈述应纳入生成病历、以及它们在得出诊断中的各自重要性存在分歧,使这一困难进一步加剧。先前对病历生成系统的真实世界评估中,专家评估者间出现了显著不一致。本文中,我们提出一种协议,旨在通过将以问诊清单为基础进行评估来提高客观性;问诊清单在预备步骤中创建,并在质量评估中作为共同参考点使用。我们在采用该协议的首次评估研究中观察到良好的标注者间一致性;此外,与使用原始人工病历相比,将研究中生成的问诊清单作为ROUGE或BERTScore等自动指标的参考,提升了它们与人类判断的相关性。
引用
@article{arxiv.2211.09455,
title = {Consultation Checklists: Standardising the Human Evaluation of Medical Note Generation},
author = {Aleksandar Savkov and Francesco Moramarco and Alex Papadopoulos Korfiatis and Mark Perera and Anya Belz and Ehud Reiter},
journal= {arXiv preprint arXiv:2211.09455},
year = {2022}
}
备注
Accepted for publication at EMNLP 2022