语言生成的极限:幻觉与模式崩塌之间的权衡
机器学习
2025-10-16 v3 人工智能
计算与语言
数据结构与算法
机器学习
摘要
明确语言模型的所有理想属性颇具挑战,但某些要求似乎必不可少。给定来自未知语言的样本,训练好的模型应能生成训练中未见过的有效字符串,并具备足够的表达力以捕捉语言的全部丰富性。否则,输出无效字符串构成“幻觉”,而无法覆盖全部范围则导致“模式崩塌”。我们探讨语言模型能否同时满足这两个要求。我们在基于 Gold 和 Angluin 的统计语言生成设定中研究此问题。模型从未知语言 的分布中接收随机样本, 属于一个可能无限的语言集合。目标是从 生成未见字符串。若随着训练样本量增加,模型输出收敛于 中所有未见字符串,则称模型能以一致性和广度从 生成。Kleinberg 和 Mullainathan [KM24] 询问一致性与广度的语言生成是否可能。我们给出否定答案:对于大类语言模型(包括下一词预测模型),这对大多数候选语言集合而言是不可能的。这与 [KM24] 的结果形成对比,后者表明对于任何可数语言集合,无广度的一致性生成是可能的。我们的发现凸显了带广度的生成与不带广度的生成在本质上有所不同。作为副产品,我们建立了带广度和不带广度生成所需样本数量的近似紧界。最后,我们的结果带来希望:当负样本( 之外的字符串)与正样本一同可用时,对于任何可数语言集合,带广度的一致性生成成为可能。这表明编码负样本的训练后反馈在减少幻觉同时限制模式崩塌方面可能至关重要。
引用
@article{arxiv.2411.09642,
title = {On the Limits of Language Generation: Trade-Offs Between Hallucination and Mode Collapse},
author = {Alkis Kalavasis and Anay Mehrotra and Grigoris Velegkas},
journal= {arXiv preprint arXiv:2411.09642},
year = {2025}
}
备注
Accepted for presentation at the 57th Symposium on Theory of Computing (STOC 2025); v3 fixes typos