后完成学习:面向语言模型的一种新型训练框架
计算与语言
2025-08-13 v3 人工智能
摘要
当前的语言模型训练范式通常在到达序列末端(<eos>)标记后终止学习,忽略了在后完成空间中潜在的学习机会。我们提出后完成学习(Post-Completion Learning,PCL),这是一种新型训练框架,系统性地利用模型输出完成后的序列空间,以增强其推理与自评估能力。PCL 使模型在训练期间能够继续生成自我评估和奖励预测,但在推理时仍可在完成时停止,以保持高效。为充分利用此后完成空间,我们设计了一种白箱强化学习方法:让模型根据奖励规则评估输出内容,然后计算并与奖励函数对齐以进行监督。我们实现了双轨 SFT,以优化推理与评估能力,并将其与 RL 训练混合,以实现多目标混合优化。在不同数据集和模型上进行的实验结果表明,我们的方法在传统 SFT 和 RL 方法上均取得一致的改进。我们的方法为语言模型训练提供了一条新技术路径,在提升输出质量的同时保持部署效率。
引用
@article{arxiv.2507.20252,
title = {Post-Completion Learning for Language Models},
author = {Xiang Fei and Siqi Wang and Shu Wei and Yuxiang Nie and Wei Shi and Hao Feng and Chao Feng and Can Huang},
journal= {arXiv preprint arXiv:2507.20252},
year = {2025}
}