UniAPL:用于指令遵循的统一对抗偏好学习框架
人工智能
2025-09-30 v1
摘要
将强大的 LLM 塑造为有益且安全的是 AI 对齐的核心。我们认为,训练后对齐从根本上说是一个统一的偏好学习问题,涉及两种模态:示范性偏好(例如,监督微调,SFT)和比较性偏好(例如,强化学习,RL)。标准的顺序流水线——先 SFT 后 RL——存在缺陷,原因在于一个关键的分布不匹配:SFT 使用静态专家数据,但随着策略的演化,其生成分布发生漂移,使得 SFT 知识变得脆弱。随后的 RL 在无法直接访问专家示范中丰富且真实的知识的情况下进行探索,导致低效、无根据的更新。这种分离阻碍了数据源之间的相互正则化。为了解决这个问题,我们将对齐重新表述为约束优化问题,并提出了统一对抗偏好学习(UniAPL),一个将策略分布与专家分布动态对齐的新框架。UniAPL 实现了单阶段统一训练目标,从 SFT 和偏好数据的混合批次中联合学习。在每个梯度步骤中,密集的专家示范直接为在线探索提供基础并进行正则化,从根本上解决了分布不匹配并最大化了数据协同。我们使用 Qwen3-235B-Instruct-2507 作为教师在指令遵循任务上评估了 UniAPL。我们的模型匹配或超越了强大的 GRPO 基线:在 Qwen3-0.6B 上提升 5.77%(匹配 32B 模型),在 Qwen3-4B 上提升 3.75%,甚至超越了教师模型。对响应长度和对数概率分布的分析证实,UniAPL 的输出紧密模仿专家示范,实现了更强的性能和更好的行为对齐。
引用
@article{arxiv.2509.25148,
title = {UniAPL: A Unified Adversarial Preference Learning Framework for Instruct-Following},
author = {FaQiang Qian and WeiKun Zhang and Ziliang Wang and Kang An and Xuhui Zheng and Liangjian Wen and Mengya Gao and Yong Dai and Yichao Wu},
journal= {arXiv preprint arXiv:2509.25148},
year = {2025}
}