UniCom:通过压缩连续语义表示实现统一多模态建模
计算机视觉与模式识别
2026-03-12 v1
摘要
当前统一多模态模型通常依赖离散视觉标记器来桥接模态差异。然而,离散化不可避免地丢弃了细粒度语义信息,导致视觉理解任务性能次优。相反,直接建模连续语义表示(如 CLIP、SigLIP)在高维生成建模中面临显著挑战,导致收敛缓慢和训练不稳定。为解决这一困境,我们引入 UniCom,一种通过压缩连续表示实现多模态理解和生成统一的框架。我们经验性地证明,降低通道维度比空间下采样在重建和生成中更为有效。因此,我们设计了基于注意力的语义压缩器,将稠密特征蒸馏到紧凑的统一表示。进一步,我们验证了 transfusion 架构在收敛性和一致性方面优于查询基准设计。实验表明,UniCom 在统一模型中实现了最先进的生成性能。值得注意的是,由于保留了丰富的语义先验,UniCom 在图像编辑中实现了卓越的可控性,且无需依赖 VAE 即可保持图像一致性。
引用
@article{arxiv.2603.10702,
title = {UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations},
author = {Yaqi Zhao and Wang Lin and Zijian Zhang and Miles Yang and Jingyuan Chen and Wentao Zhang and Zhao Zhong and Liefeng Bo},
journal= {arXiv preprint arXiv:2603.10702},
year = {2026}
}