语义公平聚类:一种简单有效的视觉标记聚类策略
计算机视觉与模式识别
2025-07-03 v3
摘要
Vision Transformer(ViT)因其卓越的关系建模能力而备受推崇。然而,其全局注意力机制的二次复杂度带来了巨大的计算负担。常见的做法是对token进行空间分组以进行自注意力计算,从而降低计算需求。然而,这种策略忽略了token中的语义信息,可能导致与语义上关联的token被分散到不同的组中,从而削弱了用于建模token间依赖关系的自注意力的有效性。针对上述见解,我们引入一种快速且均衡的聚类方法,称为语义公平聚类(Semantic Equitable Clustering,SEC)。SEC基于token的全局语义相关性进行聚类,操作高效且简单。与需要多次迭代的传统聚类方法不同,我们的方法仅需一次遍历即可完成token聚类。此外,SEC调节每个簇中token的数量,确保在无需进一步优化的情况下,各簇之间的token分布均衡,从而有效利用当前计算平台进行并行处理。基于SEC,我们提出了一种通用的视觉骨干网络,SECViT。全面的实验在图像分类、目标检测、实例分割和语义分割上验证了SECViT的有效性。此外,SEC可以方便且快速地应用于多模态大语言模型(MLLM),如LLaVA,作为视觉语言连接器使用,有效加速模型的推理速度,同时保持或改善性能。
引用
@article{arxiv.2405.13337,
title = {Semantic Equitable Clustering: A Simple and Effective Strategy for Clustering Vision Tokens},
author = {Qihang Fan and Huaibo Huang and Mingrui Chen and Ran He},
journal= {arXiv preprint arXiv:2405.13337},
year = {2025}
}
备注
Accepted by ICCV2025