HRLAIF:开放域人工智能反馈强化学习中帮助性与无害性的改进
机器学习
2024-03-15 v2 人工智能
摘要
相较于基于人类反馈的强化学习(RLHF),基于人工智能反馈的强化学习(RLAIF)具有标注周期短、成本低的优势,使其在大语言模型(LLM)训练的快速策略迭代阶段效率极高。在 RLAIF 训练中使用 ChatGPT 作为标注器为开放域提示提供反馈,我们观察到人类评估者对模型回复的偏好胜率有所提高,但评估者的满意度却有所下降。分析表明,满意度下降主要是由于部分回复的帮助性降低,特别是在正确性和真实性方面,这凸显了基础 RLAIF 的实际局限性。本文提出混合人工智能反馈强化学习(HRLAIF)。该方法提高了人工智能对回复标注的准确性,使模型在训练过程中的帮助性更加稳健。此外,它还利用人工智能进行红队测试,进一步提高了模型的无害性。人类评估结果表明,HRLAIF 继承了 RLAIF 以低成本提升人类对结果偏好的能力,同时提高了回复的满意度。与强化学习(RL)前的策略模型相比,满意度提高了 2.08%,有效解决了基础 RLAIF 后满意度下降 4.58% 的问题。
引用
@article{arxiv.2403.08309,
title = {HRLAIF: Improvements in Helpfulness and Harmlessness in Open-domain Reinforcement Learning From AI Feedback},
author = {Ang Li and Qiugen Xiao and Peng Cao and Jian Tang and Yi Yuan and Zijie Zhao and Xiaoyuan Chen and Liang Zhang and Xiangyang Li and Kaitong Yang and Weidong Guo and Yukang Gan and Xu Yu and Daniell Wang and Ying Shan},
journal= {arXiv preprint arXiv:2403.08309},
year = {2024}
}
备注
18 pages, 7 figures