TAPIOCA:为何任务感知剪枝能提升 OOD 模型能力
机器学习
2026-05-22 v2 人工智能
摘要
近期的工作提倡将任务感知层剪枝作为一种提升模型在特定任务上性能的方法,如 TALE 所示。在本文中,我们研究了这种改进何时发生以及为何发生。我们首先表明,在受控的多项式回归任务和大型语言模型中,这种剪枝对分布内 (ID) 数据没有益处,但能持续提升分布外 (OOD) 准确率。我们进一步根据经验表明,OOD 输入会引发偏离相应 ID 分布的逐层范数和成对距离分布。这引出了任务感知剪枝的几何解释:每个任务都会引发一种任务自适应的几何结构,这可以通过在 ID 输入上观察到的表示分布进行经验性刻画。OOD 输入可能会引入这种任务自适应几何结构的扭曲版本。任务感知剪枝识别出产生或放大这种扭曲的层;通过移除这些层,它将 OOD 表示范数和成对距离向在自适应分布上观察到的方向偏移。这使 OOD 输入重新对齐到模型的任务自适应几何结构,从而提升性能。我们通过受控的分布偏移和残差缩放干预提供了因果证据,并证明了在模型规模上行为的一致性。
引用
@article{arxiv.2605.14738,
title = {TAPIOCA: Why Task- Aware Pruning Improves OOD model Capability},
author = {Krish Sharma and Omar Naim and Soumadeep Saha and Vinija Jain and Aman Chadha and Nicholas Asher},
journal= {arXiv preprint arXiv:2605.14738},
year = {2026}
}