中文

一鱼两鱼,但非全海:对齐降低了语言模型的概念多样性

计算与语言 2025-07-09 v3

摘要

社会科学和心理学领域的研究者最近提出使用大型语言模型(LLMs)作为行为研究中的人类替代品。除了关于LLMs是否能准确捕捉总体层面模式的争论之外,这也引发了关于LLMs是否能捕捉类似人类的概念多样性的问题。另外,关于训练后对齐(RLHF或RLAIF)是否会影响模型内部多样性的争论也在进行中。受人类研究启发,我们采用一种新方法来衡量合成生成的LLM“群体”的概念多样性,该方法将模拟个体的内部变异性与群体层面的变异性联系起来。我们使用这种方法在具有丰富人类行为数据的两个领域评估了未对齐和对齐的LLM。虽然没有任何模型能达到人类水平的多样性,但对齐模型通常表现出比其指令微调对应模型更低的多样性。我们的研究结果凸显了提高模型价值对齐与降低其概念表征多样性之间可能存在的权衡。

关键词

引用

@article{arxiv.2411.04427,
  title  = {One fish, two fish, but not the whole sea: Alignment reduces language models' conceptual diversity},
  author = {Sonia K. Murthy and Tomer Ullman and Jennifer Hu},
  journal= {arXiv preprint arXiv:2411.04427},
  year   = {2025}
}

备注

17 pages, 10 figures; updated with publishing information