关于人类反馈强化学习社会影响的透视
计算机与社会
2023-03-07 v1 人工智能
机器学习
摘要
机器有可能像人类一样思考吗?如果可能,我们应如何教它们这样做?早在 1950 年,Alan Turing 就指出我们应以教导儿童的方式教导机器。人类反馈强化学习(RLHF)已成为使智能体以自然方式从人类反馈中学习的强有力候选。RLHF 不同于传统强化学习,因为它除奖励信号外还提供来自人类教师的反馈。它已因包括 OpenAI 的 ChatGPT、DeepMind 的 Sparrow 和 Anthropic 的 Claude 在内的多个高关注度 AI 应用而进入公众视野。这些能力极强的聊天机器人正在颠覆我们对 AI 如何与人类交互的认知。RLHF 的广泛适用性与日俱增的成功强烈催生了评估其社会影响的需求。鉴于近期进展,本文思考一个重要问题:RLHF 能否在不对人类社会产生负面影响的情况下被开发与使用?我们的目标有三:对 RLHF 的社会效应进行系统研究;识别 RLHF 的关键社会与伦理问题;并讨论对利益相关者的社会影响。尽管基于文本的 RLHF 应用备受关注,在评估其社会意涵时考量其可能被部署的广泛领域至关重要。我们描述了基于 RLHF 的技术将通过积极变革人类与 AI 的体验而影响社会的七种主要方式。本文最终提出,RLHF 有潜力在错误信息、AI 价值对齐、偏见、AI 可及性、跨文化对话、产业与劳动力方面产生净正面影响。由于 RLHF 引发了与现有 AI 技术相呼应的担忧,所有人都有必要在采用 RLHF 时保持觉察并审慎行事。
引用
@article{arxiv.2303.02891,
title = {Perspectives on the Social Impacts of Reinforcement Learning with Human Feedback},
author = {Gabrielle Kaili-May Liu},
journal= {arXiv preprint arXiv:2303.02891},
year = {2023}
}