中文

三元组优于配对:面向 LLM 的稳定有效自我对弈微调方法

计算与语言 2026-01-14 v1 机器学习

摘要

最近提出的自我对弈微调(SPIN)旨在通过迭代从模型自身生成的合成响应来适应稀缺专家标注数据下的大型语言模型。然而,SPIN 设计用于优化当前标注响应相对于手头合成响应的奖励优势,而这类优势在迭代过程中可能逐渐消失,导致优化不稳定。此外,参考策略的使用导致训练奖励公式与生成指标之间存在偏差。为此,我们提出一种新的基于三元组的自我对弈微调方法(T-SPIN),包含两个关键设计:其一,除当前优势外,T-SPIN 还整合了历史优势,即依据迭代生成的响应与初始策略产生的原生合成响应之间的优势。即便当前优势消退,历史优势仍具有效性,从而稳定整体优化。其二,T-SPIN 引入熵约束于自我对弈框架中,理论上可支持无参考微调,消除训练-生成之间的差异。在各种任务上的实证结果表明,T-SPIN 不仅优于 SPIN,且在迭代过程中表现出稳定的演化。值得注意的是,与监督式微调相比,T-SPIN 仅用 25% 的样本即可实现相当或更好的性能,凸显其在稀缺标注数据情境下的有效性。

关键词

引用

@article{arxiv.2601.08198,
  title  = {Triplets Better Than Pairs: Towards Stable and Effective Self-Play Fine-Tuning for LLMs},
  author = {Yibo Wang and Hai-Long Sun and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang and Lijun Zhang},
  journal= {arXiv preprint arXiv:2601.08198},
  year   = {2026}
}

备注

NeurIPS 2025