BHViT:二值化混合视觉 Transformer
计算机视觉与模式识别
2025-03-07 v3
摘要
模型二值化在使卷积神经网络(CNN)实现实时和节能计算方面取得了显著进展,为视觉 Transformer 在边缘设备上面临的部署挑战提供了潜在解决方案。然而,由于 CNN 和 Transformer 架构之间的结构差异,简单地将二值化 CNN 策略应用于 ViT 模型会导致显著的性能下降。为了应对这一挑战,我们提出了 BHViT,一种对二值化友好的混合 ViT 架构,并在三个重要观察的指导下提出了其全二值化模型。最初,BHViT 利用从粗到细级别的局部信息交互和分层特征聚合技术,以解决由过多 token 引起的冗余计算。然后,提出了一种基于移位操作的新颖模块,在不显著增加计算开销的情况下增强了二值化多层感知机(MLP)模块的性能。此外,提出了一种基于量化分解的创新注意力矩阵二值化方法,用于评估二值化注意力矩阵中 token 的重要性。最后,我们提出了一种正则化损失,以解决由二值化层中的权重振荡与 Adam 优化器之间的不兼容性引起的优化不足问题。大量实验结果表明,我们提出的算法在二值化 ViT 方法中实现了 SOTA 性能。
引用
@article{arxiv.2503.02394,
title = {BHViT: Binarized Hybrid Vision Transformer},
author = {Tian Gao and Zhiyuan Zhang and Yu Zhang and Huajun Liu and Kaijie Yin and Chengzhong Xu and Hui Kong},
journal= {arXiv preprint arXiv:2503.02394},
year = {2025}
}
备注
Accepted by CVPR2025