通过建模模型计算来分解和编辑预测
机器学习
2024-04-18 v1 人工智能
机器学习
摘要
机器学习模型的内部计算如何将输入转化为预测?本文引入一种称为 component modeling 的任务,以解决此问题。component modeling 的目标是以其组件——简单函数(例如,卷积滤波器、注意力头)来分解 ML 模型的预测,这些组件是模型计算的“构建块”。我们聚焦于此任务的特殊情况,即 component attribution,其中目标是估计单个组件对给定预测的反事实影响。随后,我们提出了 COAR,一种可扩展的用于估计 component attributions 的算法;我们展示了其在模型、数据集和模态性方面的有效性。最后,我们表明,使用 COAR 估计的 component attributions 直接启用了模型编辑,包括:修复模型错误、忘记特定类别、提升子群鲁棒性、局部化后门攻击以及提高对拼写错误攻击的鲁棒性。我们在 https://github.com/MadryLab/modelcomponents 提供 COAR 的代码。
引用
@article{arxiv.2404.11534,
title = {Decomposing and Editing Predictions by Modeling Model Computation},
author = {Harshay Shah and Andrew Ilyas and Aleksander Madry},
journal= {arXiv preprint arXiv:2404.11534},
year = {2024}
}