自主裁量下的AI对齐
人工智能
2025-02-18 v1 计算机与社会
机器学习
摘要
在AI对齐中,必须赋予标注者(无论是人类还是算法)广泛的自由裁量权,以判断哪些模型输出"更好"或"更安全"。我们将这种自由裁量权称为对齐自由裁量权。这种自由裁量权在很大程度上未经审视,带来两个风险:(i)标注者可能任意使用其自由裁量权,(ii)模型可能无法模仿这种自由裁量权。为研究这一现象,我们借鉴了法律中关于自由裁量权的概念,这些概念结构化了决策权如何被赋予和行使,特别是在原则冲突或其应用不明确或无关的情况下。扩展到AI对齐中,当对齐原则和规则(不可避免地)冲突或犹豫不决时,就需要自由裁量权。我们提出了一套指标来系统分析对齐自由裁量权何时以及如何被行使,使得这两个风险(i)和(ii)都能被观察到。此外,我们区分了人类自由裁量权和算法自由裁量权,并分析了它们之间的差异。通过在安全对齐数据集上测量人类和算法自由裁量权,揭示了对齐过程中此前未被考虑的多个自由裁量层次。此外,我们展示了在这些数据集上训练的算法如何发展出它们自己的自由裁量权形式来解释和应用这些原则,这挑战了拥有任何原则的目的。我们的论文是形式化当前对齐过程中这一核心差距的第一步,我们呼吁社区进一步审视和控制对齐自由裁量权。
引用
@article{arxiv.2502.10441,
title = {AI Alignment at Your Discretion},
author = {Maarten Buyl and Hadi Khalaf and Claudio Mayrink Verdun and Lucas Monteiro Paes and Caio C. Vieira Machado and Flavio du Pin Calmon},
journal= {arXiv preprint arXiv:2502.10441},
year = {2025}
}