中文

确保大型语言模型对齐与安全的基础性挑战

机器学习 2024-09-09 v2 人工智能 计算与语言 计算机与社会

摘要

本工作识别了确保大型语言模型对齐与安全方面的 18 项基础性挑战。这些挑战被组织为三个不同的类别:对 LLMs 的科学理解、开发与部署方法,以及社会技术挑战。基于所识别的挑战,我们提出了 200+200+ 个具体的研究问题。

关键词

引用

@article{arxiv.2404.09932,
  title  = {Foundational Challenges in Assuring Alignment and Safety of Large Language Models},
  author = {Usman Anwar and Abulhair Saparov and Javier Rando and Daniel Paleka and Miles Turpin and Peter Hase and Ekdeep Singh Lubana and Erik Jenner and Stephen Casper and Oliver Sourbut and Benjamin L. Edelman and Zhaowei Zhang and Mario Günther and Anton Korinek and Jose Hernandez-Orallo and Lewis Hammond and Eric Bigelow and Alexander Pan and Lauro Langosco and Tomasz Korbak and Heidi Zhang and Ruiqi Zhong and Seán Ó hÉigeartaigh and Gabriel Recchia and Giulio Corsi and Alan Chan and Markus Anderljung and Lilian Edwards and Aleksandar Petrov and Christian Schroeder de Witt and Sumeet Ramesh Motwan and Yoshua Bengio and Danqi Chen and Philip H. S. Torr and Samuel Albanie and Tegan Maharaj and Jakob Foerster and Florian Tramer and He He and Atoosa Kasirzadeh and Yejin Choi and David Krueger},
  journal= {arXiv preprint arXiv:2404.09932},
  year   = {2024}
}