宪法 AI:来自 AI 反馈的无害性
计算与语言
2022-12-19 v1 人工智能
摘要
随着 AI 系统能力日益增强,我们希望借助其帮助来监督其他 AI。我们实验了通过自我改进训练无害 AI 助手的方法,无需任何标识有害输出的人类标签。唯一的人类监督通过一组规则或原则提供,因此我们称该方法为“宪法 AI”(Constitutional AI)。该过程包含监督学习与强化学习两个阶段。在监督阶段,我们从初始模型中采样,然后生成自我批评与修订,并在修订后的响应上微调原始模型。在强化学习阶段,我们从微调后的模型采样,使用模型评估两个样本孰优孰劣,并据此 AI 偏好数据集训练偏好模型。随后我们使用该偏好模型作为奖励信号进行强化学习训练,即使用“来自 AI 反馈的 RL”(RLAIF)。由此,我们能够训练出无害但不回避的 AI 助手,其通过解释反对理由来应对有害查询。监督学习与强化学习方法均可利用思维链风格推理来提升人工评判的性能与 AI 决策的透明度。这些方法使得以远少得多的人类标签更精确地控制 AI 行为成为可能。
引用
@article{arxiv.2212.08073,
title = {Constitutional AI: Harmlessness from AI Feedback},
author = {Yuntao Bai and Saurav Kadavath and Sandipan Kundu and Amanda Askell and Jackson Kernion and Andy Jones and Anna Chen and Anna Goldie and Azalia Mirhoseini and Cameron McKinnon and Carol Chen and Catherine Olsson and Christopher Olah and Danny Hernandez and Dawn Drain and Deep Ganguli and Dustin Li and Eli Tran-Johnson and Ethan Perez and Jamie Kerr and Jared Mueller and Jeffrey Ladish and Joshua Landau and Kamal Ndousse and Kamile Lukosuite and Liane Lovitt and Michael Sellitto and Nelson Elhage and Nicholas Schiefer and Noemi Mercado and Nova DasSarma and Robert Lasenby and Robin Larson and Sam Ringer and Scott Johnston and Shauna Kravec and Sheer El Showk and Stanislav Fort and Tamera Lanham and Timothy Telleen-Lawton and Tom Conerly and Tom Henighan and Tristan Hume and Samuel R. Bowman and Zac Hatfield-Dodds and Ben Mann and Dario Amodei and Nicholas Joseph and Sam McCandlish and Tom Brown and Jared Kaplan},
journal= {arXiv preprint arXiv:2212.08073},
year = {2022}
}