中文

零阶优化遇见人类反馈:基于排序预言机的可证明学习

机器学习 2024-04-16 v3 人工智能

摘要

在本研究中,我们深入探讨一种新兴的优化挑战,其涉及只能通过排序预言机衡量的黑盒目标函数——这种情况在现实场景中频繁出现,尤其是当函数由人类评判者评估时。该挑战受人类反馈强化学习(RLHF)启发,后者是近期利用人类指导提升大语言模型(LLMs)性能的方法。我们提出ZO-RankSGD,一种专为应对该优化问题而设计的创新型零阶优化算法,并附有理论保证。我们的算法利用一种新颖的基于排序的随机估计器来确定下降方向,并保证收敛至驻点。此外,ZO-RankSGD可直接应用于强化学习(RL)中的策略优化问题,特别是当仅能获得片段奖励的排序预言机时。最后,我们在一项新颖应用中展示了ZO-RankSGD的有效性:利用人类排序反馈提升扩散生成模型所生成图像的质量。在实验中我们发现,ZO-RankSGD仅需少量人类反馈轮次即可显著增强生成图像的细节。总体而言,我们的工作通过解决仅含排序反馈的函数优化问题推进了零阶优化领域,并为使人工智能(AI)与人类意图对齐提供了新颖且有效的途径。

关键词

引用

@article{arxiv.2303.03751,
  title  = {Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles},
  author = {Zhiwei Tang and Dmitry Rybin and Tsung-Hui Chang},
  journal= {arXiv preprint arXiv:2303.03751},
  year   = {2024}
}

备注

ICLR 2024