中文

面向多模态大语言模型的语义等价化标记

计算机视觉与模式识别 2025-02-27 v4

摘要

多模态大语言模型 (MLLM) 在处理视觉语言任务方面展现出卓越的能力。MLLM 的关键在于视觉标记化技术,这涉及将输入视觉信号高效地转换为对 LLM 最有利的特征表示。然而,现有的视觉标记器对于实现视觉与语言之间的语义对齐仍存在问题。现有方法过于激进地碎片化视觉输入,破坏了视觉语义完整性。为此,本文提出一种新型动态语义等价视觉标记器 (SeTok),通过动态聚类算法将视觉特征分组为语义单元,灵活确定标记数量以适应图像复杂度。生成的视觉标记有效保留了语义完整性,并捕获低频和高频视觉特征。本文提出的配备 SeTok 的 MLLM (Setokim) 在各种任务上均显著优于现有方法,充分体现了实验结果的积极作用。项目页面位于 https://chocowu.github.io/SeTok-web/。

关键词

引用

@article{arxiv.2406.05127,
  title  = {Towards Semantic Equivalence of Tokenization in Multimodal LLM},
  author = {Shengqiong Wu and Hao Fei and Xiangtai Li and Jiayi Ji and Hanwang Zhang and Tat-Seng Chua and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2406.05127},
  year   = {2025}
}

备注

ICLR-2025. The project page: https://chocowu.github.io/SeTok-web/