中文

Constitution 或崩溃?探索 Llama 3-8B 上的宪法 AI

人工智能 2025-04-08 v1

摘要

随着语言模型不断扩大,其获取高质量训练数据的成本显著增加。收集人类反馈既昂贵又耗时,且人工标签可能存在噪声,导致有帮助性和有害性之间的不平衡。宪法 AI(Constituent AI),由 Anthropic 在 2022 年 12 月提出,使用 AI 为另一个 AI 提供反馈,大大减少了对人工标注的需求。然而,原始实现设计用于约 520 亿参数的模型,而关于宪法 AI 在较小模型(如 Llama 3-8B)上表现如何的有限信息。本文我们使用较小的 Llama 3-8B 模型复制了宪法 AI 的工作流程。我们的结果表明,宪法 AI 能够有效增加模型的无害性,使 MT-Bench 中的攻击成功率降低 40.8%。然而,类似于原始研究,增加无害性以牺牲有帮助性为代价。帮助fulness 指标(Turn 1 和 Turn 2 分数的平均值)相对于基线下降了 9.8%。此外,我们观察到最终的 DPO-CAI 模型中出现了明显的模型崩溃迹象,表明较小的模型可能在自我改进方面受限于不足的输出质量,使得有效微调更具挑战性。我们的研究表明,像推理和数学能力一样,自我改进是一种涌现属性。

关键词

引用

@article{arxiv.2504.04918,
  title  = {Constitution or Collapse? Exploring Constitutional AI with Llama 3-8B},
  author = {Xue Zhang},
  journal= {arXiv preprint arXiv:2504.04918},
  year   = {2025}
}

备注

6 pages, 2 figures. Conducted as part of research on alignment techniques for language models