中文

格式的代价:LLM 中的多样性崩溃

计算与语言 2025-05-27 v1 人工智能 机器学习

摘要

指令微调的大型语言模型(LLM)采用结构化模板(如角色标记和特殊标记)以确保推理过程中的格式一致性。然而,我们识别出这种格式化的一个关键局限性:它会引发我们称之为多样性崩溃的现象,即模型为开放式输入生成语义相似的输出,削弱了创造力和可变性。我们在故事续写和自由形式生成等任务上系统性地评估了这一效应,发现:(1)多样性崩溃即使在高温采样下仍然存在,且(2)模板中的结构标记显著限制了模型的输出空间。为此这些发现提供背景,我们对同一模型使用多种结构化提示进行微调,然后在三个维度上对其进行评估:下游任务性能、对齐行为和输出多样性。我们的分析表明,格式在微调和推理之间的一致性对于结构敏感型任务(如 GSM8K、IFEval)至关重要,但对知识密集型任务(如 MMLU、WebQuestions)影响有限。相比之下,输出多样性主要由结构标记的存在与否决定,格式最少的输出最具多样性。这一发现表明,尽管当前的提示范例在对齐方面具有积极作用,但可能无意中抑制了输出多样性,凸显了需要多样性感知的提示设计和指令微调的必要性。

关键词

引用

@article{arxiv.2505.18949,
  title  = {The Price of Format: Diversity Collapse in LLMs},
  author = {Longfei Yun and Chenyang An and Zilong Wang and Letian Peng and Jingbo Shang},
  journal= {arXiv preprint arXiv:2505.18949},
  year   = {2025}
}

备注

14 pages, 7 figures