中文

大语言模型中的词汇过度使用与对齐:学习人类反馈的影响

计算与语言 2025-08-05 v1 人工智能

摘要

大语言模型(LLM)被证实会过度使用某些词汇,如“delve”和“intricate”。然而,这些词汇选择的确切原因尚不明了。使用 Meta 的 Llama 模型,本研究探讨了学习人类反馈(LHF)的贡献,其中我们将强化学习从人类反馈(RLHF)和直接偏好优化(DPO)归为同一范畴。我们提出了一种检测 LLM 词汇偏好的简单方法,可能是 LHF 引起的。随后,我们更具有力地将 LHF 与词汇过度使用联系起来,通过模拟 LHF 程序并表明参与者系统地偏好包含这些词的文本变体。这种作为一种错位,虽然我们的研究突显了不同人群——即 LHF 工作者与 LLM 用户——之间词汇期望的潜在差异。我们的工作为解释人工智能研究的日益增长的文献添砖加瓦,强调了在对齐研究中数据与程序透明度的重要性。

关键词

引用

@article{arxiv.2508.01930,
  title  = {Word Overuse and Alignment in Large Language Models: The Influence of Learning from Human Feedback},
  author = {Tom S. Juzek and Zina B. Ward},
  journal= {arXiv preprint arXiv:2508.01930},
  year   = {2025}
}

备注

Accepted for publication in the Proceedings of the 5th Workshop on Bias and Fairness in AI (BIAS 2025) at ECML PKDD