否定导致的强幻觉及其解决方案
计算与语言
2024-08-21 v2 人工智能
摘要
尽管语言模型在许多任务上表现出色,但仍在推理方面存在挑战,有时会提供无法为真的响应,因为其源于逻辑不连贯。我们将此类响应称为"强幻觉",并证明它们源于语言模型对逻辑运算符的内部表示计算以及来自这些表示的输出。我们聚焦于否定,提出一种新方法,将否定不作为潜在表示的另一个元素,而是作为一种约束语言模型潜在表示如何演化的操作。我们展示了该方法在无需在稀疏负面数据上训练的情况下,改进了遮盖提示和自然语言推理任务中包含否定的模型性能。
引用
@article{arxiv.2402.10543,
title = {Strong hallucinations from negation and how to fix them},
author = {Nicholas Asher and Swarnadeep Bhar},
journal= {arXiv preprint arXiv:2402.10543},
year = {2024}
}
备注
Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Findings)