中文

面向高分辨率视觉语言模型的 FlexAttention

计算机视觉与模式识别 2024-07-30 v1

摘要

当前高分辨率视觉语言模型将图像编码为高分辨率图像标记,并对所有这些标记进行注意力计算,这显著增加了计算成本。为解决此问题,我们提出FlexAttention,这是一种用于高效高分辨率视觉语言模型的灵活注意力机制。具体而言,高分辨率图像同时编码为高分辨率标记和低分辨率标记,其中仅使用低分辨率标记和少数选定的高分辨率标记来计算注意力图,从而大幅缩小了计算成本。通过一个高分辨率选择模块来选择高分辨率标记,该模块可根据输入注意力图检索相关区域的标记。选定的高分辨率标记被拼接到低分辨率标记和文本标记中,输入到层次化自注意力层,以产生可用于下一步骤高分辨率标记选择的注意力图。层次化自注意力过程和高分辨率标记选择过程在每个注意力层中迭代执行。在多模态基准测试中的实验表明,FlexAttention在现有高分辨率VLM(例如在V* Bench上约9%,在TextVQA上约7%)方面均优于现有方法,同时还能显著降低计算成本,降低约40%。

关键词

引用

@article{arxiv.2407.20228,
  title  = {FlexAttention for Efficient High-Resolution Vision-Language Models},
  author = {Junyan Li and Delin Chen and Tianle Cai and Peihao Chen and Yining Hong and Zhenfang Chen and Yikang Shen and Chuang Gan},
  journal= {arXiv preprint arXiv:2407.20228},
  year   = {2024}
}

备注

Accepted by ECCV 2024