中文

冗长≠真实:揭秘大语言模型的冗长补偿行为

计算与语言 2024-12-10 v2

摘要

尽管大语言模型(LLMs)在各种任务中展示了其强大的能力,但最近的研究揭示了LLMs也表现出不良行为,如幻觉和毒性,这限制了它们的可靠性和更广泛的采用。在本文中,我们发现了一种研究不足的LLMs不良行为类型,我们称之为冗长补偿(VC),类似于人类在不确定时的犹豫行为,即他们用过多的词语进行回应,例如重复问题、引入歧义或提供过多的枚举。我们首次定义并分析了冗长补偿,探讨了其成因,并提出了一种简单的缓解方法。我们在五个基于知识和推理的问答任务数据集上,使用14个新开发的LLMs进行的实验揭示了三个结论。1)我们揭示了VC在所有模型和所有数据集中的普遍存在。值得注意的是,GPT-4表现出50.40%的VC频率。2)我们揭示了冗长回应与简洁回应之间的巨大性能差距,在Qasper数据集上差异高达27.61%。我们还证明,这种差异并不会随着LLM能力的提高而自然缩小。1)和2)都凸显了降低VC行为频率以及将冗长性与真实性解耦的迫切需要。我们提出了一种简单而有效的级联算法,用其他模型生成的回应替换冗长回应。结果表明,我们的方法有效地将Mistral模型在Qasper数据集上的VC从63.81%降低到16.16%。3)我们还发现,在所有五个数据集中,冗长回应都表现出更高的不确定性,这表明冗长性与模型不确定性之间存在紧密联系。我们的数据集和代码可在 https://github.com/psunlpgroup/VerbosityLLM 获取。

关键词

引用

@article{arxiv.2411.07858,
  title  = {Verbosity $\neq$ Veracity: Demystify Verbosity Compensation Behavior of Large Language Models},
  author = {Yusen Zhang and Sarkar Snigdha Sarathi Das and Rui Zhang},
  journal= {arXiv preprint arXiv:2411.07858},
  year   = {2024}
}

备注

22 pages, 7 figures