针对长程医院病程摘要忠实度指标的元评估
计算与语言
2023-03-08 v1
摘要
医院入院记录的长程临床摘要具有现实意义,因其可能帮助临床医生与患者。摘要的忠实度对其在临床环境中的安全使用至关重要。为更好地理解抽取式系统的局限性以及现有评估指标的适用性,我们以细粒度人工标注为基准,针对模型生成的患者简要医院病程摘要,对忠实度指标进行基准测试。我们构建了一组 HIV 患者队列的入院与摘要语料,每位患者均有复杂病史。标注者查看摘要与源记录,并手动将高亮的摘要要素(临床实体如疾病与药物,以及如“随访”等动作)归类为“不正确”“缺失”或“不在记录中”三类之一。我们对一组广泛的已提出的忠实度指标进行元评估,并跨指标探究领域自适应(例如领域内预训练与指标微调的影响)、源-摘要对齐的使用,以及从既有指标集成中蒸馏单一指标的效果。未经临床文本训练的现成指标相关性良好,但过度依赖摘要的抽取性。作为长程临床叙事摘要的实用指南,我们发现大多数指标在每次提供一句摘要及最少相关源上下文时,与人类判断相关性最佳。
引用
@article{arxiv.2303.03948,
title = {A Meta-Evaluation of Faithfulness Metrics for Long-Form Hospital-Course Summarization},
author = {Griffin Adams and Jason Zucker and Noémie Elhadad},
journal= {arXiv preprint arXiv:2303.03948},
year = {2023}
}
备注
Preprint