用于组合、隐私与删除的切向Transformer
机器学习
2024-05-16 v3
摘要
我们提出切向注意力微调(TAFT),一种通过对预训练初始化计算一阶泰勒展开(First-order Taylor Expansion)来微调线性化Transformer的方法。我们表明,由线性化产生的雅可比向量积(Jacobian-Vector Product)可在单次前向传播中高效计算,在参数量相同的情况下,将训练与推理代价降至与原非线性模型同数量级。此外,我们表明,当应用于多种下游视觉分类任务时,使用TAFT微调得到的切向Transformer(Tangent Transformer)可与微调原非线性网络取得相当性能。由于切向Transformer相对于新权重集是线性的,且所得微调损失是凸的,我们表明TAFT在模型组合、并行训练、机器遗忘(machine unlearning)和差分隐私方面相比非线性微调具有若干优势。我们的代码见:https://github.com/tianyu139/tangent-model-composition
引用
@article{arxiv.2307.08122,
title = {Tangent Transformers for Composition, Privacy and Removal},
author = {Tian Yu Liu and Aditya Golatkar and Stefano Soatto},
journal= {arXiv preprint arXiv:2307.08122},
year = {2024}
}
备注
Published at the International Conference on Learning Representations (ICLR) 2024. Code available at: https://github.com/tianyu139/tangent-model-composition