中文

用于组合、隐私与删除的切向Transformer

机器学习 2024-05-16 v3

摘要

我们提出切向注意力微调(TAFT),一种通过对预训练初始化计算一阶泰勒展开(First-order Taylor Expansion)来微调线性化Transformer的方法。我们表明,由线性化产生的雅可比向量积(Jacobian-Vector Product)可在单次前向传播中高效计算,在参数量相同的情况下,将训练与推理代价降至与原非线性模型同数量级。此外,我们表明,当应用于多种下游视觉分类任务时,使用TAFT微调得到的切向Transformer(Tangent Transformer)可与微调原非线性网络取得相当性能。由于切向Transformer相对于新权重集是线性的,且所得微调损失是凸的,我们表明TAFT在模型组合、并行训练、机器遗忘(machine unlearning)和差分隐私方面相比非线性微调具有若干优势。我们的代码见:https://github.com/tianyu139/tangent-model-composition

关键词

引用

@article{arxiv.2307.08122,
  title  = {Tangent Transformers for Composition, Privacy and Removal},
  author = {Tian Yu Liu and Aditya Golatkar and Stefano Soatto},
  journal= {arXiv preprint arXiv:2307.08122},
  year   = {2024}
}

备注

Published at the International Conference on Learning Representations (ICLR) 2024. Code available at: https://github.com/tianyu139/tangent-model-composition