基于注意力双压缩的ViT分离学习通信高效实现
机器学习
2025-09-19 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
本文提出了一种新型的通信高效分离学习(Split Learning,SL)框架,称为基于注意力双压缩(Attention-based Double Compression,ADC),该框架在SL训练过程中传输Vision Transformer激活中间结果时显著降低通信开销。ADC包含两种并行压缩策略。第一种策略基于最后一个客户端层中计算的平均注意力得分,将相似的样本激活合并;该策略是类别无关的,即即使合并不同类别的样本,也不会损失泛化能力或降低最终结果。第二种策略遵循第一策略,进一步丢弃最不有意义的标记,以进一步降低通信成本。将这些策略组合起来,不仅可以在前向传播期间发送更少的数据,而且梯度也自然地被压缩,无需额外调优或梯度近似即可训练整个模型。仿真结果表明,基于注意力双压缩的框架在保持高精度的同时,显著优于当前最先进的SL框架,降低了通信开销。
引用
@article{arxiv.2509.15058,
title = {Communication Efficient Split Learning of ViTs with Attention-based Double Compression},
author = {Federico Alvetreti and Jary Pomponi and Paolo Di Lorenzo and Simone Scardapane},
journal= {arXiv preprint arXiv:2509.15058},
year = {2025}
}