中文

来自人类反馈的强化学习:谁的文化,谁的价值,谁的视角?

计算机与社会 2025-05-27 v2 人工智能 计算与语言 人机交互

摘要

我们主张在大型语言模型(LLM)的语境下,通过社会认识论和多元主义科学哲学,提出将强化学习从人类反馈(RLHF)置于多元主义立场的认识论与伦理优势。我们建议如何使RLHF更能响应人类需求,并在此过程中应对挑战。本文以行动议程收尾,即为改进LLM开发提供具体可操作的步骤。

关键词

引用

@article{arxiv.2407.17482,
  title  = {Reinforcement Learning from Human Feedback: Whose Culture, Whose Values, Whose Perspectives?},
  author = {Kristian González Barman and Simon Lohse and Henk de Regt},
  journal= {arXiv preprint arXiv:2407.17482},
  year   = {2025}
}