通过叙事检测语言模型的模式崩溃
计算与语言
2025-02-28 v1 人工智能
摘要
没有哪两位作者写作风格完全相同。书面叙事中从词汇到修辞手法所调用的个人特色,暗示着某位特定的作者——文学理论家将其称为隐含作者或虚拟作者;有别于文本的真实作者或叙述者。在未经过滤的、来自各种不一致来源的训练集上训练的早期大型语言模型产生了不连贯的个性,这在对话任务中存在问题,但对于从多个视角采样文学作品却很有用。近年来对齐研究的成功使研究人员能够通过指令微调和基于人类反馈的强化学习(RLHF)在语言模型中施加主观上一致的拟人角色,但对齐后的模型是否保留了建模任意虚拟作者的能力却鲜少受到审视。通过研究从三个OpenAI语言模型中采样的4,374个故事,我们表明GPT-3的后续版本出现了日益严重的“模式崩溃”,即在对齐过程中对模型的过拟合限制了其对作者身份的泛化:遭受模式崩溃的模型变得无法呈现多重视角。我们的方法和结果对于寻求在社会学模拟中应用语言模型的研究人员具有重要意义。
引用
@article{arxiv.2402.04477,
title = {Detecting Mode Collapse in Language Models via Narration},
author = {Sil Hamilton},
journal= {arXiv preprint arXiv:2402.04477},
year = {2025}
}
备注
To appear in the proceedings of the first Workshop on the Scaling Behavior of Large Language Models (EACL 2024)