ModHiFi:用于模型修改的高保真预测组件识别
机器学习
2026-01-19 v2 机器学习
摘要
开放权重模型屡见不鲜,但很少提供其训练数据或损失函数。这使得受限于数据和损失函数不可用性的修改此类模型(如修剪或遗忘)成为活跃的研究领域。现有技术通常需要梯度或真实标签,在计算资源有限的环境中难以实现。本文我们探讨了在缺乏梯度或损失函数访问、仅通过如合成数据等分布访问的情况下,识别对模型预测性能至关重要的组件的根本问题。我们理论上证明,对于 Lipschitz 连续的网络(如 CNN 和经过良好训练的 Transformer),全局误差线性界限于局部重构误差。我们发现,基于组件子集的局部可重构行为可用于量化其全局重要性,通过一种称为子集保真度的度量来实现。在无关特征设置下,基于其子集保真度分数选择单个组件是最优的,这一发现我们用于提出 ModHiFi—an 一种不需训练数据也无需损失函数访问即可进行模型修改的算法。ModHiFi-P 在 ImageNet 模型上相对于当前最新技术实现 11% 的加速,同时在语言模型上表现出竞争力。ModHiFi-U 在 CIFAR-10 上实现完全遗忘(无需微调),并在 Swin Transformer 上表现出竞争力。
引用
@article{arxiv.2511.19566,
title = {ModHiFi: Identifying High Fidelity predictive components for Model Modification},
author = {Dhruva Kashyap and Chaitanya Murti and Pranav K Nayak and Tanay Narshana and Chiranjib Bhattacharyya},
journal= {arXiv preprint arXiv:2511.19566},
year = {2026}
}
备注
NeurIPS 2025 (Spotlight). Our code is available at https://github.com/DhruvaKashyap/modhifi