中文

通过 De-focus Attention Networks 学习 1D 因果视觉表征

计算机视觉与模式识别 2024-06-07 v1

摘要

模式差异导致了针对视觉和语言模型开发异构架构的趋势。虽然图像通常需要 2D 非因果建模,但文本则利用 1D 因果建模。这种区别在构建统一的多模态模型方面提出了重大挑战。本文探讨了使用 1D 因果建模表示图像的可行性。我们识别出现有 1D 因果视觉模型中的“过度聚焦”问题,即注意力过于集中在视觉标记的少数比例上。“过度聚焦”问题阻碍了模型提取多样化视觉特征的能力,以及接收有效梯度以进行优化。为解决此问题,我们提出 De-focus Attention Networks,采用可学习的带通滤波器创建多样化的注意力模式。在训练期间,引入大规模的计划 drop path 率以及针对全局池化特征的辅助损失,用于全局理解任务。这两种策略鼓励模型关注更广泛的标记范围并增强网络优化。大量实验验证了我们方法的有效性,证明 1D 因果视觉表征在全局感知、密集预测和多模态理解等任务中可与 2D 非因果表征相当。代码发布于 https://github.com/OpenGVLab/De-focus-Attention-Networks。

关键词

引用

@article{arxiv.2406.04342,
  title  = {Learning 1D Causal Visual Representation with De-focus Attention Networks},
  author = {Chenxin Tao and Xizhou Zhu and Shiqian Su and Lewei Lu and Changyao Tian and Xuan Luo and Gao Huang and Hongsheng Li and Yu Qiao and Jie Zhou and Jifeng Dai},
  journal= {arXiv preprint arXiv:2406.04342},
  year   = {2024}
}