Hadamard 注意力循环 Transformer:立体匹配 Transformer 的强基线
计算机视觉与模式识别
2025-08-26 v5
摘要
受注意力机制中固有的低秩瓶颈限制,当前的立体匹配 Transformer 非线性表达能力有限,这使其特征表示对反射等挑战性条件敏感。为了克服这一困难,我们提出了 Hadamard 注意力循环立体 Transformer (HART)。HART 包含一种新颖的注意力机制,该机制包含以下组件:1) 密集注意力核 (DAK) 将注意力权重分布映射到 (0, +) 上的高维空间。通过移除对注意力权重的上限约束,DAK 能够更灵活地建模复杂的特征交互。这降低了特征共线性。2) 多核与阶交互 (MKOI) 模块通过统一语义和空间知识学习来扩展注意力机制。这种整合提高了 HART 在双目图像中学习特征的能力。实验结果证明了我们 HART 的有效性。在反射区域,HART 在提交时在 KITTI 2012 基准上位列所有已发表方法的第一名。代码可在 https://github.com/ZYangChen/HART 获取。
引用
@article{arxiv.2501.01023,
title = {Hadamard Attention Recurrent Transformer: A Strong Baseline for Stereo Matching Transformer},
author = {Ziyang Chen and Wenting Li and Yongjun Zhang and Yabo Wu and Bingshu Wang and Yong Zhao and C. L. Philip Chen},
journal= {arXiv preprint arXiv:2501.01023},
year = {2025}
}