保持大语言模型监督微调中的多样性
机器学习
2025-04-08 v2 人工智能
摘要
大语言模型(LLM)通常依赖监督微调(SFT)以专注于下游任务,交叉熵(CE)损失是事实上的首选。然而,CE 最大化观察数据的可能性,而不考虑备选可能性。因此,CE 通常导致模型输出的多样性降低,这阻碍了需要通过抽样探索更佳响应的后续发展。在本文中,我们引入一种新的博弈论表述用于 SFT。在该框架中,引入了一个辅助变量来调节学习过程。我们证明,所提出的博弈论方法与逆 KL 最小化问题相联系,并伴随熵正则化。这种正则化防止对训练数据的过度记忆,促进输出多样性。为实现此框架,我们开发了 GEM,这是一种新的训练算法,由于利用 LLM 的某些独特特性,计算效率与 CE相当。对 3B 至 70B 参数的预训练模型进行的实证研究表明,GEM 在保持与 CE 相当的下游性能的同时,显著提升了输出多样性。这种增加的多样性在聊天和代码生成任务的测试时计算扩展中 translates 为性能提升。此外,我们观察到保持输出多样性还有助于减轻遗忘,因为维持多样化的输出鼓励模型在整个训练过程中保留预训练知识。
引用
@article{arxiv.2408.16673,
title = {Preserving Diversity in Supervised Fine-Tuning of Large Language Models},
author = {Ziniu Li and Congliang Chen and Tian Xu and Zeyu Qin and Jiancong Xiao and Zhi-Quan Luo and Ruoyu Sun},
journal= {arXiv preprint arXiv:2408.16673},
year = {2025}
}
备注
accepted by ICLR 2025