中文

解码对齐:通过价值观设定与数据中心视角审视大语言模型开发计划的临界综述

计算与语言 2025-08-26 v1

摘要

人工智能对齐(主要以强化学习从人类反馈(RLHF)的形式)是开发大语言模型(LLM)后训练阶段的基石,也是计算机科学之外多个学科(包括哲学和法学等)的热门研究主题,凸显了涉及的社会技术挑战。然而,除与对齐相关的计算技术外,对这些过程更广泛图景的关注仍有限:这些过程主要依赖所选定的目标(价值观),以及收集和使用的用于将这些价值观灌输到模型中的数据。本工作旨在从价值观设定和数据中心视角揭示在实践中对齐是如何被理解和应用的。为此目的,我们调查并调查了6个LLM开发计划公开发布的文档,该计划由5个塑造该技术的领先组织推出,主要包括专有(OpenAI的GPT、Anthropic的Claude、Google的Gemini)和开源权重(Llama、Gemma、Qwen),全部发布于过去3年。每个计划的发现都有详细记录,同时也有一个关于不同方面的总体概述,主要从价值观设定和数据中心视角进行。基于我们的发现,我们讨论了一系列更广泛的相关问题。

关键词

引用

@article{arxiv.2508.16982,
  title  = {Decoding Alignment: A Critical Survey of LLM Development Initiatives through Value-setting and Data-centric Lens},
  author = {Ilias Chalkidis},
  journal= {arXiv preprint arXiv:2508.16982},
  year   = {2025}
}

备注

This is a working paper and will be updated with new information or corrections based on community feedback