中文

面向人类对齐的偏好排序优化

计算与语言 2024-02-28 v2 人工智能

摘要

大语言模型(LLMs)常包含误导性内容,强调需要将其与人类价值观对齐以确保人工智能系统的安全。基于人类反馈的强化学习(RLHF)已被用于实现这种对齐。然而,它存在两个主要缺陷:(1)与SFT相比,RLHF表现出复杂性、不稳定性以及对超参数的敏感性。(2)尽管进行了大量试错,多次采样被简化为成对对比,因而缺乏宏观视角的对比。在本文中,我们提出偏好排序优化(PRO)作为一种高效的SFT算法,直接对LLMs进行微调以实现人类对齐。PRO将成对对比扩展为容纳任意长度的偏好排序。通过迭代对比候选响应,PRO指导LLM优先选择最佳响应,同时逐步对其余响应进行排序。以此方式,PRO有效地将人类对齐转化为使LLM生成的n个响应的概率排序与人类对这些响应的偏好排序相对齐。实验表明,PRO优于基线算法,在基于自动、基于奖励、GPT-4以及人类评估中取得了与ChatGPT和人类响应相当的结果。

关键词

引用

@article{arxiv.2306.17492,
  title  = {Preference Ranking Optimization for Human Alignment},
  author = {Feifan Song and Bowen Yu and Minghao Li and Haiyang Yu and Fei Huang and Yongbin Li and Houfeng Wang},
  journal= {arXiv preprint arXiv:2306.17492},
  year   = {2024}
}

备注

Accepted by AAAI 2024