中文

WeMMU:通过无噪声查询标记增强视觉语言模型与扩散模型的桥接

计算机视觉与模式识别 2025-12-03 v1

摘要

最近的多模态大语言模型(MLLM)进展凸显了高效桥接预训练视觉语言模型(VLM)与扩散模型的挑战。虽然使用固定数量可学习查询标记的方法具有计算效率,但会因无法适应与预训练任务遥远的新任务而导致任务泛化崩溃。为克服这一问题,我们提出了无噪声查询标记(Noisy Query Tokens),通过端到端优化学习分布表示空间,将 VLM 和扩散模型之间的表示进行桥接,以增强持续学习。此外,我们引入带线性投影的 VAE 分支来恢复细粒度图像细节。实验结果确认,我们的方法缓解了泛化崩溃,使其在 diverse 任务上实现稳定的持续学习。

关键词

引用

@article{arxiv.2512.02536,
  title  = {WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens},
  author = {Jian Yang and Dacheng Yin and Xiaoxuan He and Yong Li and Fengyun Rao and Jing Lyu and Wei Zhai and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2512.02536},
  year   = {2025}
}