中文

面向边缘高效 Transformer 语义通信的自适应 Token 合并

机器学习 2025-09-15 v1 人工智能 计算机视觉与模式识别 图像与视频处理

摘要

大规模 Transformer 是现代语义通信的核心,但其高昂的计算和通信成本阻碍了在资源受限的边缘设备上的部署。本文引入了一种无需训练的自适应 Token 合并框架,这是一种新颖的机制,通过在每层相似度阈值下选择性地合并语义冗余的 Token,在运行时压缩 Transformer 表示。与以往固定比例的缩减方法不同,我们的方法将合并直接与输入冗余耦合,实现了依赖于数据的自适应,在不重新训练的情况下平衡了效率和任务相关性。我们将合并策略的发现转化为一个多目标优化问题,并利用贝叶斯优化在准确率、推理成本和通信成本之间获得帕累托最优权衡。在 ImageNet 分类任务上,我们以减少 30% 的每秒浮点运算次数和低于 20% 的原始通信成本,达到了未修改 Transformer 的准确率;而在视觉问答任务中,我们的方法在不到三分之一的计算量和十分之一的带宽下,取得了与完整 LLaVA 模型相媲美的性能。最后,我们表明我们的自适应合并在不同的信道条件下具有鲁棒性,并提供了固有的隐私益处,大幅降低了模型反演攻击的有效性。我们的框架为在资源受限的边缘智能场景中部署强大的 Transformer 模型提供了一种实用且通用的解决方案。

关键词

引用

@article{arxiv.2509.09955,
  title  = {Adaptive Token Merging for Efficient Transformer Semantic Communication at the Edge},
  author = {Omar Erak and Omar Alhussein and Hatem Abou-Zeid and Mehdi Bennis and Sami Muhaidat},
  journal= {arXiv preprint arXiv:2509.09955},
  year   = {2025}
}

备注

Submitted to IEEE Journals