中文

通过最优对偶化实现大型语言模型的一次性安全对齐

人工智能 2024-11-25 v3 计算与语言 机器学习 最优化与控制 机器学习

摘要

大型语言模型日益增长的安全问题迫切需要使其与多样的人类偏好对齐,以同时增强其有用性和安全性。一种有前景的方法是通过基于人类反馈的强化学习(RLHF)来强制执行安全约束。对于这种约束RLHF,典型的基于拉格朗日的原始-对偶策略优化方法计算成本高且通常不稳定。本文提出一种对偶化视角,将约束对齐简化为等价的无约束对齐问题。我们通过预优化一个具有闭式形式的平滑凸对偶函数来实现这一点。这种捷径消除了繁琐的原始-对偶策略迭代的需要,大大减少了计算负担并提高了训练稳定性。我们的策略在基于模型和基于偏好的设置中产生了两种实用算法(分别为MoCAN和PeCAN)。大量实验证明了我们算法的有效性和优势。

关键词

引用

@article{arxiv.2405.19544,
  title  = {One-Shot Safety Alignment for Large Language Models via Optimal Dualization},
  author = {Xinmeng Huang and Shuo Li and Edgar Dobriban and Osbert Bastani and Hamed Hassani and Dongsheng Ding},
  journal= {arXiv preprint arXiv:2405.19544},
  year   = {2024}
}

备注

32 pages, 6 figures, 8 tables