通过学习注入事实错误来改进事实错误校正
计算与语言
2023-12-13 v1
摘要
事实错误校正(Factual Error Correction, FEC)旨在以最少的编辑修正虚假声明中的事实错误,使其忠实于提供的证据。该任务对于缓解大语言模型遇到的幻觉问题至关重要。鉴于缺乏配对数据(即虚假声明及其相应的正确声明),现有方法通常采用“先掩码后校正”范式。该范式仅依赖未配对的虚假声明和正确声明,因此被称为远监督方法。这些方法需要掩码器在校正器进行修正之前,明确识别虚假声明中的事实错误。然而,缺乏用于训练掩码器的配对数据使得准确定位声明中的事实错误极具挑战性。为了缓解这一问题,我们提出通过学习注入事实错误(Learning to Inject Factual Errors, LIFE)来改进 FEC,这是一种三步远监督方法:掩码-破坏-校正。具体而言,我们首先使用“先掩码后破坏”过程训练一个破坏器,使其能够故意向正确文本中引入事实错误。然后将该破坏器应用于正确声明,生成大量配对数据。之后,我们过滤掉低质量数据,并使用剩余数据训练校正器。值得注意的是,我们的校正器不需要掩码器,从而规避了与显式事实错误识别相关的瓶颈。我们在公开数据集上的实验从两个关键方面验证了 LIFE 的有效性:首先,它在 SARI Final 上比此前表现最好的远监督方法显著高出 10.59 分(提升 19.3%)。其次,即使与使用上下文示例提示的 ChatGPT 相比,LIFE 在 SARI Final 上也取得了 7.16 分的优势。
引用
@article{arxiv.2312.07049,
title = {Improving Factual Error Correction by Learning to Inject Factual Errors},
author = {Xingwei He and Qianru Zhang and A-Long Jin and Jun Ma and Yuan Yuan and Siu Ming Yiu},
journal= {arXiv preprint arXiv:2312.07049},
year = {2023}
}
备注
Accepted to AAAI 2024