InfoTok:基于信息论的统一MLLMs中容量受限共享视觉分词正则化
机器学习
2026-04-07 v2 人工智能
计算机视觉与模式识别
摘要
统一多模态大语言模型(MLLMs)旨在单一框架内统一图像理解与图像生成,其中共享视觉分词器作为唯一接口,将高维图像映射到受限的token预算,以支持下游多模态推理与合成。然而,现有的共享token设计往往基于体系结构,缺乏明确的保留准则,以同时支持语义抽象和视觉细节。在本文中,我们采用容量受限的视角,将共享分词器视为计算受限的学习者,其有限的表示预算应优先保留可复用的结构,而非难以利用的高熵变化和冗余信息。鼓励此观点,我们提出了基于信息瓶颈(Information Bottleneck, IB)原则的InfoTok——一种信息正则化的分词机制。InfoTok通过施加互信息(MI)约束,显式控制从图像到共享token及多模态输出的信息流,实施压缩与任务相关性之间的原则性权衡,同时鼓励跨模态一致性。由于MI在高维视觉表示下难以计算,本文采用可微的依赖估计器实现InfoTok,包括变分IB公式和基于希尔伯特-史密斯独立性准则(Hilbert Schmidt Independence Criterion, HSIC)的替代方案。无需引入额外训练数据,将InfoTok集成到三个代表性统一MLLMs中,始终提升图像理解和生成性能。这些结果支持信息正则化的视觉分词作为统一MLLMs中token学习的合理基础。
引用
@article{arxiv.2602.01554,
title = {InfoTok: Information-Theoretic Regularization for Capacity-Constrained Shared Visual Tokenization in Unified MLLMs},
author = {Lv Tang and Tianyi Zheng and Bo Li and Xingyu Li},
journal= {arXiv preprint arXiv:2602.01554},
year = {2026}
}