FactPICO:医学证据通俗语言摘要的事实性评估
计算与语言
2024-06-06 v2
摘要
利用大语言模型进行通俗语言摘要有助于提高技术内容的文本可访问性。但是,在医学这样的高风险领域,这些摘要的事实性如何?本文提出了 FactPICO,这是一个针对描述随机对照试验(RCT)的医学文本通俗语言摘要的事实性基准,RCT 是循证医学的基础,可直接指导患者治疗。FactPICO 包含由三个 LLM(即 GPT-4、Llama-2 和 Alpaca)生成的 345 份 RCT 摘要的通俗语言版本,并附有专家的细粒度评估和自然语言理由。我们评估了这些摘要中 RCT 关键要素的事实性:人群、干预措施、对照、结果(PICO),以及关于这些要素的报告发现。我们还评估了 LLM 添加的额外信息(例如解释)的正确性。利用 FactPICO,我们对一系列现有的事实性指标进行了基准测试,包括新设计的基于 LLM 的指标。我们发现,医学证据的通俗语言摘要仍然具有挑战性,特别是在平衡简洁性和事实性方面,且现有指标在实例层面与专家判断的相关性较差。
引用
@article{arxiv.2402.11456,
title = {FactPICO: Factuality Evaluation for Plain Language Summarization of Medical Evidence},
author = {Sebastian Antony Joseph and Lily Chen and Jan Trienes and Hannah Louisa Göke and Monika Coers and Wei Xu and Byron C Wallace and Junyi Jessy Li},
journal= {arXiv preprint arXiv:2402.11456},
year = {2024}
}
备注
Preprint has been updated to match the final revision for ACL 2024