通过宪法进行模型行为的解释与控制:原子概念编辑的框架
机器学习
2026-02-03 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
我们引入一种黑箱可解释框架,通过学习可验证的宪法来总结提示变更如何影响模型特定行为,如其对齐、正确性或约束遵循程度。我们的方法利用原子概念编辑(ACE),这些是添加、移除或替换输入提示中可解释概念的针对性操作。通过系统性地应用ACE并观察模型行为在各种任务上的结果,本框架学习从编辑到可预测结果的因果映射。所学宪法为模型提供深入且可推广的洞见。我们在包括数学推理与文本到图像对齐等多种任务上进行了实证验证,以控制和理解模型行为。我们发现,对于文本到图像生成,GPT-Image倾向于关注语法遵循度,而Imagen 4优先考虑大气一致性。在数学推理中,干扰变量会混淆GPT-5,但对Gemini 2.5模型和o4-mini几乎无影响。此外,我们的结果表明,所学宪法在控制模型行为方面效果显著,成功率平均提升1.86倍。
引用
@article{arxiv.2602.00092,
title = {Interpreting and Controlling Model Behavior via Constitutions for Atomic Concept Edits},
author = {Neha Kalibhat and Zi Wang and Prasoon Bajpai and Drew Proud and Wenjun Zeng and Been Kim and Mani Malek},
journal= {arXiv preprint arXiv:2602.00092},
year = {2026}
}