WeMMU:通过无噪声查询标记增强视觉语言模型与扩散模型的桥接
计算机视觉与模式识别
2025-12-03 v1
摘要
最近的多模态大语言模型(MLLM)进展凸显了高效桥接预训练视觉语言模型(VLM)与扩散模型的挑战。虽然使用固定数量可学习查询标记的方法具有计算效率,但会因无法适应与预训练任务遥远的新任务而导致任务泛化崩溃。为克服这一问题,我们提出了无噪声查询标记(Noisy Query Tokens),通过端到端优化学习分布表示空间,将 VLM 和扩散模型之间的表示进行桥接,以增强持续学习。此外,我们引入带线性投影的 VAE 分支来恢复细粒度图像细节。实验结果确认,我们的方法缓解了泛化崩溃,使其在 diverse 任务上实现稳定的持续学习。
引用
@article{arxiv.2512.02536,
title = {WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens},
author = {Jian Yang and Dacheng Yin and Xiaoxuan He and Yong Li and Fengyun Rao and Jing Lyu and Wei Zhai and Yang Cao and Zheng-Jun Zha},
journal= {arXiv preprint arXiv:2512.02536},
year = {2025}
}