中文

集体宪法 AI:面向公众输入的语言模型对齐

人工智能 2024-06-13 v1 计算与语言 人机交互

摘要

越来越多的人认为,语言模型开发者不应是语言模型行为的唯一决策者,这需要方法来使更广泛的公众能够共同塑造影响他们的语言模型系统的行为。为此,我们提出了集体宪法 AI(CCAI):一个面向从源头识别目标人群、获取原则、进行训练和评估的多阶段过程,以整合公众输入到语言模型中。我们通过创建 what is, to our knowledge, 第一个获得集体来源公众输入而微调的语言模型,并将其评估于基线模型(后者使用来自语言模型开发者的既定原则进行训练),展示了该方法的实际可行性。我们的定量评估表明,该方法的多项优势:CCAI 训练的模型在九个社会维度上偏见较低,而在语言、数学和有帮助-无害评估方面性能相当。定性比较表明,模型在各自的宪法基础上存在差异,例如,当被提示涉及争议议题时,CCAI 训练的模型倾向于以积极方式重新表述问题,而非拒绝。这些结果表明,面向公众输入的语言模型开发呈现出有前景且可操作的路径。

关键词

引用

@article{arxiv.2406.07814,
  title  = {Collective Constitutional AI: Aligning a Language Model with Public Input},
  author = {Saffron Huang and Divya Siddarth and Liane Lovitt and Thomas I. Liao and Esin Durmus and Alex Tamkin and Deep Ganguli},
  journal= {arXiv preprint arXiv:2406.07814},
  year   = {2024}
}