少即是多:改进事实一致性的自动评估
计算与语言
2024-04-11 v1 人工智能
机器学习
摘要
评估自动生成文本相对于源上下文的事实一致性对于开发可靠的自然语言生成应用至关重要。近期文献提出了AlignScore,它使用统一的对齐模型来评估事实一致性,并在许多基准任务上显著优于先前方法。在本文中,我们仔细审视了AlignScore中使用的数据集,并发现了一个意外的结果:使用更少的数据点实际上可以提高性能。我们处理了原始的AlignScore训练数据集以去除噪声,用鲁棒性增强的样本进行扩充,并利用仅占数据10%的子集训练了一个改进的事实一致性评估模型,我们称之为LIM-RA(少即是多的鲁棒AlignScore)。LIM-RA表现出优越的性能,在四个基准测试(两个使用传统自然语言生成数据集,两个专注于大语言模型输出)上持续优于AlignScore和ChatGPT等其他强基线。我们的实验表明,LIM-RA在33个测试数据集中的24个上取得了最高分,在其余数据集上保持竞争力,确立了新的最先进基准。
引用
@article{arxiv.2404.06579,
title = {Less is More for Improving Automatic Evaluation of Factual Consistency},
author = {Tong Wang and Ninad Kulkarni and Yanjun Qi},
journal= {arXiv preprint arXiv:2404.06579},
year = {2024}
}
备注
Accepted in NAACL24 Industry; 7 pages