谁该获得赞誉或承担过错?现代AI系统中的问责归因
机器学习
2026-02-10 v4 人工智能
摘要
现代AI系统通常通过多个阶段开发——预训练、多轮微调以及随后的适应或对齐,其中每个阶段都建立在前一阶段之上并以不同方式更新模型。这引发了一个关于问责的关键问题:当部署的模型成功或失败时,哪个阶段应负责,且责任程度如何?我们提出问责归因问题,旨在将模型行为追溯至模型开发过程的具体阶段。为应对这一挑战,我们提出了一个通用框架来回答关于阶段效应的反事实问题:如果某一阶段的更新未发生,模型行为将如何变化?在该框架内,我们引入了无需重新训练模型即可高效量化阶段效应的估计器,同时兼顾了数据和模型优化动力学的关键方面,包括学习率调度、动量和权重衰减。我们证明,我们的方法成功量化了每个阶段对模型行为的问责。基于归因结果,我们的方法能够识别并消除在跨多阶段开发的图像分类和文本毒性检测任务中学习到的虚假相关性。我们的方法为模型分析提供了实用工具,代表了迈向更具问责性的AI开发的重要一步。
引用
@article{arxiv.2506.00175,
title = {Who Gets Credit or Blame? Attributing Accountability in Modern AI Systems},
author = {Shichang Zhang and Hongzhe Du and Jiaqi W. Ma and Himabindu Lakkaraju},
journal= {arXiv preprint arXiv:2506.00175},
year = {2026}
}