中文

SFT-GO:基于群优化的大语言模型监督微调

机器学习 2025-06-19 v1 人工智能

摘要

监督式微调 (SFT) 已成为针对大语言模型 (LLM) 对齐人类期望并适应具体下游任务的关键步骤。然而,现有的 SFT 方法通常将每个训练实例视为均匀序列,无论其相关性如何,对所有 token 赋予相同的重要性。这忽略了只有其中一小部分 token 往往包含关键任务相关信息的事实。为此,我们引入一种新方法:基于群优化的监督式微调 (SFT-GO),该方法根据 token 的重要性对其进行分组。SFT-GO 根据 token 的重要性对每个样本中的 token 进行分组,并使用最差群损失与标准交叉熵损失的加权组合来优化 LLM。这种机制自适应地强调最具挑战性的 token 群,引导模型更好地处理不同群的分布,从而改进整体学习动力学。我们对 SFT-GO 的收敛率进行了理论分析,表明其效率。经验上,我们采用三种不同的 token 分组策略应用 SFT-GO,显示使用 SFT-GO 训练的模型在流行 LLM 基准测试中 consistently 超过基线方法。这些改进适用于各种数据集和基础模型,显示该方法的鲁棒性和有效性。

关键词

引用

@article{arxiv.2506.15021,
  title  = {SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models},
  author = {Gyuhak Kim and Sumiran Singh Thakur and Su Min Park and Wei Wei and Yujia Bao},
  journal= {arXiv preprint arXiv:2506.15021},
  year   = {2025}
}