中文

软偏好优化:将语言模型对齐至专家分布

机器学习 2024-10-07 v4 人工智能

摘要

我们提出了软偏好优化(SPO),一种将生成模型(如大语言模型(LLM))与人类偏好对齐而无需奖励模型的方法。SPO 通过一个自然的损失函数直接在偏好数据集上优化模型输出,该损失函数将偏好损失与正则化项相结合,作用于模型的整个输出分布,而非仅限于偏好数据集。尽管 SPO 不需要假设存在底层奖励模型,但我们证明了,在 Bradley-Terry (BT) 模型假设下,它收敛至缩放奖励的 softmax,且该分布的“柔软度”可通过算法参数(即 softmax 指数)进行调节。我们展示了 SPO 的方法论、理论基础,及其在简单性、计算效率和 Alignment 精度方面的比较优势。

关键词

引用

@article{arxiv.2405.00747,
  title  = {Soft Preference Optimization: Aligning Language Models to Expert Distributions},
  author = {Arsalan Sharifnassab and Saber Salehkaleybar and Sina Ghiassian and Surya Kanoria and Dale Schuurmans},
  journal= {arXiv preprint arXiv:2405.00747},
  year   = {2024}
}