中文

同质分词器至关重要:面向遥感图像理解的同质视觉分词器

计算机视觉与模式识别 2024-10-15 v2 人工智能

摘要

分词器作为大模型的基础组件之一,在视觉任务中长期被忽视甚至误解。大语言模型强大理解能力的一个关键因素是,自然语言分词器利用有意义的词或子词作为语言的基本元素。相比之下,以 Patch Embed 等基于块的方法为代表的主流视觉分词器,依赖无意义的矩形块作为视觉的基本元素,无法像语言中的词或子词那样有效发挥作用。从分词器的本质出发,我们为视觉定义了语义独立区域(SIR)。我们设计了一个简单的同质视觉分词器:HOOK。HOOK 主要由两个模块组成:对象感知模块(OPM)和对象向量化模块(OVM)。为实现同质性,OPM 将图像分割为 4×4 像素的种子,然后利用注意力机制感知 SIR。OVM 采用交叉注意力将同一 SIR 内的种子合并。为实现自适应性,OVM 定义了可变数量的可学习向量作为交叉注意力查询,从而允许调整分词数量。我们在 NWPU-RESISC45、WHU-RS19 分类数据集和 GID5 分割数据集上针对稀疏和密集任务进行了实验。结果表明,HOOK 获得的视觉分词对应于单个对象,这证明了同质性。HOOK 在这两项任务中分别比 Patch Embed 高出 6% 和 10%,并且与用于比较的基线相比达到了最先进的性能。与每幅图像需要超过一百个分词的 Patch Embed 相比,HOOK 在稀疏和密集任务中分别仅需 6 个和 8 个分词,从而实现了 1.5 到 2.8 倍的效率提升。代码可在 https://github.com/GeoX-Lab/Hook 获取。

关键词

引用

@article{arxiv.2403.18593,
  title  = {Homogeneous Tokenizer Matters: Homogeneous Visual Tokenizer for Remote Sensing Image Understanding},
  author = {Run Shao and Zhaoyang Zhang and Chao Tao and Yunsheng Zhang and Chengli Peng and Haifeng Li},
  journal= {arXiv preprint arXiv:2403.18593},
  year   = {2024}
}

备注

24 pages, 9 figures, 8 tables