预训练语言模型对不忠实幻觉文本返回可区分的概率分布
计算与语言
2024-09-26 v1
摘要
在这项工作中,我们表明预训练语言模型对不忠实幻觉文本返回可区分的生成概率和不确定性分布,无论其规模和结构如何。通过在 6 个数据集上检查 24 个模型,我们发现在 88-98% 的情况下,模型返回了在统计上显著可区分的生成概率和不确定性分布。利用这一普遍现象,我们展示了一种减少幻觉的训练算法。我们的算法在保持良好的一般文本质量指标的同时,实现了更高的忠实度指标,从而优于其他基线方法。
引用
@article{arxiv.2409.16658,
title = {Pre-trained Language Models Return Distinguishable Probability Distributions to Unfaithfully Hallucinated Texts},
author = {Taehun Cha and Donghun Lee},
journal= {arXiv preprint arXiv:2409.16658},
year = {2024}
}
备注
10 pages, EMNLP 2024 Findings