TokenCom:面向多模态和多任务 token 通信的视觉语言模型
计算机视觉与模式识别
2026-03-03 v1 信息论
math.IT
摘要
视觉语言模型(VLM)凭借其在图像和文本理解方面的强大能力,为智能通信提供了坚实的基础。然而,其有效性受限于 token 粒度有限、视觉 token 序列过长以及跨模态对齐不足的挑战。为克服这些问题,我们提出了TaiChi,这是一个面向 token 通信的新型 VLM 框架。TaiChi 采用双视觉 tokenizer 架构,处理高低分辨率图像,以协同方式捕获像素级细节和全局概念特征。引入双向注意力网络(BAN),智能融合多尺度视觉 token,从而增强视觉理解并生成紧凑的视觉 token。此外,采用基于Kolmogorov Arnold 网络(KAN)的模态投影器,包含可学习的激活函数,以实现从视觉特征到文本语义空间的精确非线性对齐,从而最小化信息损失。最后,TaiChi 集成到一个多模态多任务 token 通信系统中,配备联合 VLM-channel 编码方案。实验结果表明,TaiChi 表现优异,并且 TaiChi 驱动的 token 通信系统具有可行性和有效性。
引用
@article{arxiv.2603.00482,
title = {TokenCom: Vision-Language Model for Multimodal and Multitask Token Communications},
author = {Feibo Jiang and Siwei Tu and Li Dong and Xiaolong Li and Kezhi Wang and Cunhua Pan and Zhu Han and Jiangzhou Wang},
journal= {arXiv preprint arXiv:2603.00482},
year = {2026}
}