大型语言模型用于数据到文本生成中事实一致性的广泛评估
计算与语言
2024-12-02 v1
摘要
大型语言模型(LLMs)在各种数据到文本生成(DTG)任务中表现出卓越的性能。然而,在DTG任务中生成事实一致的文本仍然具有挑战性。尽管如此,当前文献中缺乏对LLMs在DTG中事实一致性的深入评估。这篇论文通过提供对LLMs在DTG中事实一致性的广泛评估来弥补这一空白。我们的评估涵盖五个广泛使用的DTG数据集(E2E、ViGGo、WikiTableText、DART和WebNLG),以及五大主流的LLM系列(T5、BART、OPT、BLOOM和Llama 2)。为确保对事实一致性进行全面评估,我们使用四种最先进的自动度量指标,并包含必要的人类评估。我们的广泛评估揭示了关于LLMs在DTG中事实一致性的三个关键发现。首先,Llama 2在生成事实一致的文本方面往往表现出色,尽管较小的模型如T5和BART可以在较大规模、词汇较少样本多样性的数据集上实现强好的事实一致性。其次,平均变化率(AROC)表明,模型规模(可训练参数数量)通常会提高LLMs在DTG中的事实一致性。第三,我们观察到,源参考间的差异(即参考文本在语义上与来源文本发生偏离)通常会降低LLMs在DTG中的事实一致性。
引用
@article{arxiv.2411.19203,
title = {An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation},
author = {Joy Mahapatra and Utpal Garain},
journal= {arXiv preprint arXiv:2411.19203},
year = {2024}
}
备注
15 pages