面向多模态大语言模型的语义等价化标记
计算机视觉与模式识别
2025-02-27 v4
摘要
多模态大语言模型 (MLLM) 在处理视觉语言任务方面展现出卓越的能力。MLLM 的关键在于视觉标记化技术,这涉及将输入视觉信号高效地转换为对 LLM 最有利的特征表示。然而,现有的视觉标记器对于实现视觉与语言之间的语义对齐仍存在问题。现有方法过于激进地碎片化视觉输入,破坏了视觉语义完整性。为此,本文提出一种新型动态语义等价视觉标记器 (SeTok),通过动态聚类算法将视觉特征分组为语义单元,灵活确定标记数量以适应图像复杂度。生成的视觉标记有效保留了语义完整性,并捕获低频和高频视觉特征。本文提出的配备 SeTok 的 MLLM (Setokim) 在各种任务上均显著优于现有方法,充分体现了实验结果的积极作用。项目页面位于 https://chocowu.github.io/SeTok-web/。
引用
@article{arxiv.2406.05127,
title = {Towards Semantic Equivalence of Tokenization in Multimodal LLM},
author = {Shengqiong Wu and Hao Fei and Xiangtai Li and Jiayi Ji and Hanwang Zhang and Tat-Seng Chua and Shuicheng Yan},
journal= {arXiv preprint arXiv:2406.05127},
year = {2025}
}
备注
ICLR-2025. The project page: https://chocowu.github.io/SeTok-web/