LatentUMM:双向潜在对齐的统一多模态模型
计算机视觉与模式识别
2026-05-19 v1
摘要
统一多模态模型 (UMMs) 通过学习共享潜在空间实现在理解和生成方面的强大性能,但往往在这两项能力之间 exhibit functional inconsistency。我们观察到,这一问题并不源于共享表征的不足,而是源于缺乏对将进入和离开潜在空间的转换之间的显式对齐。结果是,生成和重新编码可以遵循不一致的轨迹,导致在模态转换下出现语义漂移。在本工作中,我们提出LatentUMM,一个构建增强共享潜在空间以显式对齐这些转换并提高跨模态一致性的框架。LatentUMM 包含两个阶段。首先,双向潜在对齐在模态和容量两个层面强制一致性:跨模态对齐使用更强的嵌入模型以施加结构化的跨模态语义,而双向容量对齐则在生成和重新编码之间强制双向一致性。其次,潜在动态稳定性通过随机潜在滚动和偏好优化来提高鲁棒性,优先选择能够更好保持语义一致性的轨迹。实验表明,LatentUMM 在多种架构上均显著提高了多模态一致性。代码可在 https://github.com/AIFrontierLab/TorchUMM/tree/main/src/umm/post_training/LatentUMM 获取。
引用
@article{arxiv.2605.17766,
title = {LatentUMM: Dual Latent Alignment for Unified Multimodal Models},
author = {Yinyi Luo and Wenwen Wang and Hayes Bai and Marios Savvides and Jindong Wang},
journal= {arXiv preprint arXiv:2605.17766},
year = {2026}
}