中文

基础模型在随机性与创造力方面优于对齐模型

计算与语言 2025-09-16 v2

摘要

对齐技术已迅速成为LLM开发的默认组成部分,包括强化学习从人类反馈等技术,使模型能够安全地遵循指令并在复杂任务上表现更好。虽然这些技术当然有用,但我们主张其不应被普遍应用,并展示了一系列任务,其中基础语言模型持续优于其流行的对齐形式。特别是,我们研究需要不可预测输出的任务,如随机数生成、混合策略游戏(石头剪子布和找猫捉鼠),以及创意写作。在每种情况下,对齐模型倾向于产生狭窄行为,导致显著劣势,例如偏好生成“7”而非其他均匀随机数,在某些游戏状态下几乎完全可预测,或优先生成愉悦而非富有创意的写作。我们测试的模型之间,更好的基准表现与较差的我们任务表现呈正相关,表明在所需能力之间存在有效权衡。

关键词

引用

@article{arxiv.2505.00047,
  title  = {Base Models Beat Aligned Models at Randomness and Creativity},
  author = {Peter West and Christopher Potts},
  journal= {arXiv preprint arXiv:2505.00047},
  year   = {2025}
}