中文

大语言模型中针对主观人类偏好与价值观的反馈学习的过去、现在与更好未来

计算与语言 2023-10-12 v1 计算机与社会

摘要

人类反馈正日益被用于引导大语言模型(LLMs)的行为。然而,如何以高效、有效且无偏的方式收集和整合反馈仍不明确,尤其是对于高度主观的人类偏好与价值观。本文综述了现有从人类反馈中学习的方法,主要参考了来自 ACL 与 arXiv 仓库的 95 篇论文。首先,我们总结了将人类反馈整合进语言模型的过去(LLM 之前)趋势。其次,我们概述了当前的技术与实践,以及使用反馈的动机;用于定义价值观与偏好的概念框架;以及反馈如何收集、由谁收集。最后,我们通过提出五个未解决的概念与实践挑战,倡导 LLM 中反馈学习的更好未来。

关键词

引用

@article{arxiv.2310.07629,
  title  = {The Past, Present and Better Future of Feedback Learning in Large Language Models for Subjective Human Preferences and Values},
  author = {Hannah Rose Kirk and Andrew M. Bean and Bertie Vidgen and Paul Röttger and Scott A. Hale},
  journal= {arXiv preprint arXiv:2310.07629},
  year   = {2023}
}

备注

Accepted for the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP, Main)