PlainQAFact:面向生物医学通俗语言摘要的检索增强事实一致性评估指标
计算与语言
2026-03-20 v4
摘要
大型语言模型(LLM)产生的幻觉输出在医疗领域构成风险,尤其对于做出健康相关决定的非专业受众。现有的自动事实一致性评估方法(如基于蕴含关系和基于问答(QA)的方法)在处理通俗语言摘要(PLS)时存在困难,原因是引申解释现象会引入科学摘要中不存在的外部内容(如定义、背景、示例)以增强理解。为解决这一问题,我们引入了 PlainQAFact,这是一种在细粒度人工标注数据集 PlainFact 上训练的自动事实一致性评估指标,用于评估源简化句和引申解释句的事实一致性。PlainQAFact 首先对句子类型进行分类,随后应用检索增强的 QA 评分方法。实证结果表明,现有评估指标无法有效评估 PLS 中的事实一致性,尤其是引申解释部分,而 PlainQAFact 在所有评估设置下均持续优于它们。我们进一步分析了 PlainQAFact 在外部知识源、答案提取策略、答案重叠度量及文档粒度层级上的有效性,从而优化了其整体事实一致性评估。总而言之,本工作提出了一种针对生物医学 PLS 任务中引申解释的句子感知型检索增强指标,为社区提供了新的基准和实用评估工具,以推动医疗领域可靠且安全的通俗语言交流。PlainQAFact 和 PlainFact 可在以下地址获取:https://github.com/zhiwenyou103/PlainQAFact
引用
@article{arxiv.2503.08890,
title = {PlainQAFact: Retrieval-augmented Factual Consistency Evaluation Metric for Biomedical Plain Language Summarization},
author = {Zhiwen You and Yue Guo},
journal= {arXiv preprint arXiv:2503.08890},
year = {2026}
}
备注
Accepted by Journal of Biomedical Informatics