中文

强化学习人类反馈中的伦理与说服:基于程序修辞的分析

计算机与社会 2025-05-15 v1 人工智能

摘要

自 2022 年起,诸如 ChatGPT 和 Claude 等生成式 AI 聊天机器人版本已采用称为强化学习从人类反馈 (Reinforcement Learning from Human Feedback, RLHF) 的专用技术进行训练,以微调语言模型的输出,利用来自人类标注员的反馈。因此,RLHF 的集成大大增强了这些大型语言模型 (Large Language Model, LLM) 的输出,使其与仅使用监督学习的以往版本相比,交互和响应更显‘人性化’。人类文本与机器生成文本的日益趋同,可能对透明度、信任、偏见以及人际关系产生严重的伦理、社会技术和教育学影响。为突出这些影响,本文提出了对部分核心程序和流程的修辞分析,这些流程正在被 RLHF 提升的生成式 AI 聊天机器人所重塑:维持语言规范、信息寻求实践以及社会关系的期望。迄今为止,对生成式 AI 和 LLM 的修辞研究主要聚焦于生成内容的说服力。本文借鉴 Ian Bogost 的‘程序修辞'概念,将修辞调查的焦点从内容分析转向内置于 RLHF 提升的 LLM 中用于说服的底层机制。通过此方法,本理论性调查为进一步的 AI 伦理学研究开辟了新方向,考虑通过 AI 驱动的技术重路由何强化主导性语言使用的惯例、延续偏见、去语境化学习以及侵占人际关系。因此,本文将引起教育者、研究者、学者以及日益增多的生成式 AI 聊天机器人用户的关注。

关键词

引用

@article{arxiv.2505.09576,
  title  = {Ethics and Persuasion in Reinforcement Learning from Human Feedback: A Procedural Rhetorical Approach},
  author = {Shannon Lodoen and Alexi Orchard},
  journal= {arXiv preprint arXiv:2505.09576},
  year   = {2025}
}

备注

10 pages, 1 figure, Accepted version