最优消融法
机器学习
2024-09-17 v1
摘要
解释性研究通常涉及跟踪机器学习模型中信息流,以识别执行特定任务相关计算的特定模型组件。先前的工作通过对执行消融操作或模拟该组件被禁用时的模型推理来量化模型组件对特定任务的重要性。我们提出了一种新方法——最优消融(optimal ablation, OA),并展示了基于OA的组件重要性在理论和实证方面相对于其他消融方法具有优势。我们还表明,基于OA的组件重要性可受益于several下游解释性任务,包括电路发现、事实记忆定位以及潜在预测。
引用
@article{arxiv.2409.09951,
title = {Optimal ablation for interpretability},
author = {Maximilian Li and Lucas Janson},
journal= {arXiv preprint arXiv:2409.09951},
year = {2024}
}