中文

目标条件监督学习用于 LLM 微调

机器学习 2026-05-19 v1 人工智能

摘要

大型语言模型通常需要进行微调以更好地对齐其部署时的行为与用户意图。现有方法通常分为在线和离线两类。基于 RL 的在线方法(如 PPO)可以直接优化结果质量,但通常依赖外部奖励模型和迭代式采样,使得成本高昂且在许多情况下难以部署。离线方法更高效,但现有的做法(如监督微调 SFT 和直接偏好优化 DPO)仍存在局限:SFT 通常将分级反馈折叠为二元监督,而 DPO 则依赖往往不可得或昂贵构建的配对偏好数据。本文提出目标条件监督学习(GCSL)作为 LLM 的离线微调框架。我们的核心思想是将反馈信号直接视为一个明确的目标,并通过纯监督学习训练模型,以生成实现该目标的响应。为更好地利用分级反馈,我们进一步引入一种新颖的目标表述,将学习定义为持续地追求高于目标质量阈值之上的结果,而不是模仿来自所选高质量子集的样本。这种设计通过显式引导模型学习质量的方向性进展,缓解了 SFT 和经典 GCSL 中的有界学习效应。我们还提出了自然语言目标表述,以更好地利用 LLM 的语义理解和推理能力。在三个任务上进行评估:非有害生成、代码生成和 LLM 推荐。结果表明,我们的方法在保持监督学习的效率、可扩展性和简单数据需求的同时,在所有离线微调基准中均表现出一致的优势。

关键词

引用

@article{arxiv.2605.16345,
  title  = {Goal-Conditioned Supervised Learning for LLM Fine-Tuning},
  author = {Shijun Li and Kaiwen Dong and Xiang Gao and Joydeep Ghosh},
  journal= {arXiv preprint arXiv:2605.16345},
  year   = {2026}
}