通过人类反馈强化学习进行 AI 对齐?——矛盾与局限
人工智能
2024-06-27 v1
摘要
本文批判性地评估了通过强化学习从人类反馈(RLHF)或 AI 反馈(RLAIF)来实现人工智能(AI)系统,尤其是大型语言模型(LLM)与人类价值观和意图相匹配的方法。具体而言,我们展示了在广泛推进的对齐目标——诚实、无害和有帮助——方面的不足之处。通过多学科的社会技术批判,我们审视了 RLxF 技术的理论基础和实际实现,揭示了其在捕捉人类伦理复杂性方面存在显著局限,以及对 AI 安全贡献的限制。我们强调了 RLxF 目标中固有的紧张关系和矛盾。此外,我们讨论了在关于对齐和 RLxF 的讨论中容易被忽视的伦理相关问题,包括用户友好性与欺骗之间的权衡、灵活性与可解释性之间的权衡,以及系统安全方面的权衡。我们 concludes by 呼吁研究人员和实践者共同批判性地评估 RLxF 的社会技术影响,主张在 AI 发展中采取更为细致和反思性的方法。
引用
@article{arxiv.2406.18346,
title = {AI Alignment through Reinforcement Learning from Human Feedback? Contradictions and Limitations},
author = {Adam Dahlgren Lindström and Leila Methnani and Lea Krause and Petter Ericson and Íñigo Martínez de Rituerto de Troya and Dimitri Coelho Mollo and Roel Dobbe},
journal= {arXiv preprint arXiv:2406.18346},
year = {2024}
}
备注
12 pages, 1 table, to be submitted