中文

从指令到内在人类价值——大模型对齐目标综述

人工智能 2023-09-06 v2 计算与语言 计算机与社会

摘要

以大型语言模型(LLM)为代表的大模型通常是在海量数据上预训练且包含巨量参数的模型,它们不仅在多样化任务中获得了显著改进的性能,还呈现出较小模型中不存在的涌现能力。然而,大模型与日常人类生活的日益交织带来了潜在风险,并可能造成严重的社会危害。因此,许多工作致力于将 LLM 与人类对齐,使其更好地遵循用户指令并满足人类偏好。然而,“与什么对齐”尚未得到充分讨论,而不恰当的对齐目标甚至可能适得其反。在本文中,我们对现有工作中不同的对齐目标进行了全面综述,并追溯其演进路径,以帮助识别最关键的目标。特别地,我们从两个视角考察了相关工作:对齐目标的定义与对齐评估。我们的分析涵盖了三个不同层次的对齐目标,并揭示了从基础能力到价值导向的目标转变,表明内在人类价值作为增强型 LLM 对齐目标的潜力。基于此类结果,我们进一步讨论了实现这种内在价值对齐的挑战,并提供了用于未来大模型对齐研究的可用资源集合。

关键词

引用

@article{arxiv.2308.12014,
  title  = {From Instructions to Intrinsic Human Values -- A Survey of Alignment Goals for Big Models},
  author = {Jing Yao and Xiaoyuan Yi and Xiting Wang and Jindong Wang and Xing Xie},
  journal= {arXiv preprint arXiv:2308.12014},
  year   = {2023}
}

备注

20 pages, 5 figures