输出多样性在后训练时期何处崩溃
计算与语言
2026-04-20 v1 人工智能
机器学习
摘要
后训练语言模型产生的输出比其基础模型更少样本化。这一输出多样性崩溃削弱了依赖于变异样本的推理时间扩展方法,并风险地同质化模型在创意和价值驱动任务上的输出。先前的工作将崩溃归因于特定的后训练方法,却未区分训练数据组成与方法之间的作用,或模型权重与生成格式之间的作用。在本研究中,我们通过三条平行的后训练脉络(Olmo 3, Think 链条思维蒸馏, Instruct 广泛多来源数据, RL-Zero),跨越15项任务和四种文本多样性指标,追踪输出多样性。我们发现崩溃位置随数据组成而变化:Think 脉络在监督微调时失去大部分语义多样性,DPO在Instruct中的作用大于在Think中。抑制Think模型在推理时的链条思维推理会降低困难任务的准确率,但不影响答案层面的多样性,表明崩溃嵌入了模型权重中的训练数据,而非由生成格式强加。将六项可验证任务上的多样性损失分解为质量控制组成(错误输出的移除)和残余组成(正确输出中真实缩窄),揭示该分解取决于任务,尽管在整体上Think模型在正确答案多样性上保持更多样本,却在聚合多样性上崩溃更严重。我们的结果表明,多样性崩溃是在训练过程中由数据组成决定的,无法仅通过推理时间解决。
引用
@article{arxiv.2604.16027,
title = {Where does output diversity collapse in post-training?},
author = {Constantinos Karouzos and Xingwei Tan and Nikolaos Aletras},
journal= {arXiv preprint arXiv:2604.16027},
year = {2026}
}