中文

C3AI:构建与评估宪法式 AI 的框架

人工智能 2025-02-25 v1 计算与语言

摘要

宪法式 AI(CAI)通过宪法指导 LLM 行为,但确定哪些原则最有效以实现模型对齐仍是开放挑战。我们引入 C3AI 框架("Craft Constitution for CAI Models"),其包含两个关键功能:(1)在微调前选择并构建有效宪法的原则;(2)评估微调后的 CAI 模型在实践中是否遵循这些原则。通过分析来自 AI 与心理学的原则,我们发现以积极措辞、基于行为的原则比以消极措辞或基于特质的原则更贴近人类偏好。在安全对齐场景中,我们应用图基原则选择方法来优化现有 CAI 宪法,在保持强大常规推理能力的同时提升安全措施。有趣的是,微调后的 CAI 模型在消极措辞原则上表现良好,但在积极措辞原则上则表现不佳,这与我们的 human 对齐结果形成鲜明对比。这凸显了原则设计与模型遵循度之间的潜在鸿沟。总体而言,C3AI 提供了一种结构化且可扩展的构建与评估 CAI 宪法的方法。

关键词

引用

@article{arxiv.2502.15861,
  title  = {C3AI: Crafting and Evaluating Constitutions for Constitutional AI},
  author = {Yara Kyrychenko and Ke Zhou and Edyta Bogucka and Daniele Quercia},
  journal= {arXiv preprint arXiv:2502.15861},
  year   = {2025}
}

备注

This has been accepted for the Web Conference 2025