基础模型在随机性与创造力方面优于对齐模型
计算与语言
2025-09-16 v2
摘要
对齐技术已迅速成为LLM开发的默认组成部分,包括强化学习从人类反馈等技术,使模型能够安全地遵循指令并在复杂任务上表现更好。虽然这些技术当然有用,但我们主张其不应被普遍应用,并展示了一系列任务,其中基础语言模型持续优于其流行的对齐形式。特别是,我们研究需要不可预测输出的任务,如随机数生成、混合策略游戏(石头剪子布和找猫捉鼠),以及创意写作。在每种情况下,对齐模型倾向于产生狭窄行为,导致显著劣势,例如偏好生成“7”而非其他均匀随机数,在某些游戏状态下几乎完全可预测,或优先生成愉悦而非富有创意的写作。我们测试的模型之间,更好的基准表现与较差的我们任务表现呈正相关,表明在所需能力之间存在有效权衡。
引用
@article{arxiv.2505.00047,
title = {Base Models Beat Aligned Models at Randomness and Creativity},
author = {Peter West and Christopher Potts},
journal= {arXiv preprint arXiv:2505.00047},
year = {2025}
}