受约束语言模型政策优化的分步对齐
机器学习
2024-10-22 v3 人工智能
计算与语言
摘要
安全性和可信度是大型语言模型(LLM)在实际应用中不可或缺的要求。本文将人类价值对齐形式化为在安全约束下最大化奖励的语言模型政策优化问题,随后提出一种算法——受约束政策优化的分步对齐(Stepwise Alignment for Constrained Policy Optimization, SACPO)。SACPO 的核心思想之一,得到理论支持,表明将奖励与安全相结合的最优政策可直接从已对齐奖励的政策中获得。基于这一核心思想,SACPO 逐步对齐每个指标,同时利用诸如直接偏好优化(DPO)等简单而强大的对齐算法。SACPO 具有简洁性、稳定性、计算效率和算法与数据集灵活性等优势。在 mild 假设下,我们的理论分析提供了关于最优性和安全约束违反的上界。我们的实验结果表明,SACPO 在帮助fulness 和 harmlessness 两个方面均优于当前最先进的方法。
引用
@article{arxiv.2404.11049,
title = {Stepwise Alignment for Constrained Language Model Policy Optimization},
author = {Akifumi Wachi and Thien Q. Tran and Rei Sato and Takumi Tanabe and Youhei Akimoto},
journal= {arXiv preprint arXiv:2404.11049},
year = {2024}
}
备注
Accepted at NeurIPS 2024. Code and models are available at https://github.com/line/sacpo