用于微调 LLM 的基于团队自博弈与双重自适应加权方法
计算与语言
2026-05-12 v1 人工智能
摘要
尽管最近的自训练方法减少了对齐 LLM 对人工标注数据的依赖,但它们仍面临关键局限性:(i) 对合成数据质量敏感,导致迭代训练中的不稳定性和偏差放大;(ii) 随着训练迭代进行,正负响应之间的差距缩小,导致优化无效。在本文中,我们提出了基于团队自博弈与双重自适应加权 (TPAW),一种旨在完全自监督设置下改进对齐的新型自博弈算法。TPAW 采用基于团队的框架,其中当前策略模型既与历史检查点合作又与之竞争,促进更稳定和高效的优化。为了进一步增强学习,我们设计了两种自适应加权机制:(i) 一种调整目标响应重要性的响应重加权方案,以及 (ii) 一种在训练期间动态调节每个团队成员贡献的玩家加权策略。从 SFT 模型初始化,TPAW 无需额外人工监督即可迭代细化对齐。实验结果表明,TPAW 在各种基础模型和 LLM 基准测试中始终优于现有基线。我们的代码已在 https://github.com/lab-klc/TPAW 公开。
引用
@article{arxiv.2605.09922,
title = {Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs},
author = {Wu Li and Yigeng Zhou and Zesheng Shi and Yequan Wang and Min Zhang and Jing Li},
journal= {arXiv preprint arXiv:2605.09922},
year = {2026}
}
备注
Accepted by ACL 2026 Main