基于合成器的视觉任务高效自注意力
计算机视觉与模式识别
2024-10-01 v2 机器学习
摘要
自注意力模块在捕获长程关系的同时提升了视觉任务(如图像分类与图像描述)的性能,表现出卓越能力。然而,自注意力模块高度依赖查询-键-值特征间的点积乘法与维度对齐,这导致两个问题:(1) 点积乘法造成详尽且冗余的计算。(2) 由于视觉特征图常表现为多维张量,重塑张量特征尺度以适应维度对齐可能破坏张量特征图的内部结构。为解决这些问题,本文提出一种带变体的自注意力插件模块,即合成张量变换(STT),用于直接处理图像张量特征。在不计算查询-键-值间点积乘法的情况下,基础 STT 由张量变换组成,以从视觉信息中学习合成注意力权重。STT 系列的有效性在图像分类与图像描述上得到验证。实验表明,在上述视觉任务中,所提 STT 相较于自注意力在保持鲁棒性的同时取得了具竞争力的性能。
引用
@article{arxiv.2201.01410,
title = {Synthesizer Based Efficient Self-Attention for Vision Tasks},
author = {Guangyang Zhu and Jianfeng Zhang and Yuanzhi Feng and Hai Lan},
journal= {arXiv preprint arXiv:2201.01410},
year = {2024}
}
备注
15 pages,7 figures