基于单 GPU 的凸优化对齐与偏好学习
机器学习
2026-05-25 v1
摘要
通过微调大型语言模型(LLM)以符合人类偏好,已推动了 Gemini 和 ChatGPT 等系统的成功。然而,像强化学习从人类反馈(RLHF)这样的方法仍昂贵且复杂。直接偏好优化(DPO)提供了一种更简单的替代方案,但存在排序准确性不一致、对 GPU 资源高度依赖以及昂贵的超参数调优等局限性。我们提出了凸优化对齐与偏好学习算法(COALA):一种具有强大理论保证的轻量级策略。通过利用神经网络的凸优化重构,COALA 省去参考模型的需求,显著减少训练时间和 VRAM 消耗,从而实现在单张 GPU 上的高效训练。在包括 26,621 条人工生成教育反馈数据集在内的四个数据集上以及包括 Llama-3.1-8B 在内的六个模型实验中,COALA 展现出竞争性能的同时实现了显著的效率提升,仅使用约 17.6% 的 DPO 总 TFLOPs。COALA 显示出稳定、单调递增的奖励,并在显著缩短的时间内达到最高的边际收益,与传统方法如 DPO 和 ORPO 相比表现更佳。据我们所知,这是首次将凸优化有效应用于大型语言模型的偏好微调。
引用
@article{arxiv.2605.23244,
title = {Convex Optimization for Alignment and Preference Learning on a Single GPU},
author = {Miria Feng and Mert Pilanci},
journal= {arXiv preprint arXiv:2605.23244},
year = {2026}
}