中文

会诊笔记生成中的人工评估及其与自动指标的相关性

计算与语言 2022-04-04 v1

摘要

近年来,机器学习模型生成临床会诊笔记的能力迅速提升;然而,关于如何恰当评估所生成的会诊笔记以理解其对使用笔记的临床医生及患者临床安全的影响,相关研究甚少。为此,我们呈现一项针对会诊笔记的大规模人工评估研究:5名临床医生(i)聆听57场模拟会诊,(ii)撰写自己的笔记,(iii)对若干自动生成笔记进行后编辑,以及(iv)提取所有错误(定量与定性)。随后,我们对18个自动质量指标与人工判断进行相关性研究。我们发现,简单的基于字符的Levenshtein距离指标表现与常见基于模型的指标(如BertScore)相当甚至更优。我们的所有发现与标注均已开源。

关键词

引用

@article{arxiv.2204.00447,
  title  = {Human Evaluation and Correlation with Automatic Metrics in Consultation Note Generation},
  author = {Francesco Moramarco and Alex Papadopoulos Korfiatis and Mark Perera and Damir Juric and Jack Flann and Ehud Reiter and Anya Belz and Aleksandar Savkov},
  journal= {arXiv preprint arXiv:2204.00447},
  year   = {2022}
}

备注

To be published in proceedings of ACL 2022