Mobile-O:移动设备上的统一多模态理解与生成
计算机视觉与模式识别
2026-02-25 v2
摘要
统一多模态模型能够在单一架构中进行视觉内容的理解与生成。然而,现有模型数据需求大,难以部署在边缘设备上。我们提出 Mobile-O—a 一个紧凑的视觉-语言-扩散模型,为移动设备带来统一的多模态智能。其核心模块 Mobile Conditioning Projector(MCP)采用深度可分离卷积和层级对齐,将视觉-语言特征与扩散生成器融合。该设计在最小计算成本下实现高效的跨模态条件。我们仅用几百万样本进行训练,并以一种新颖的四分之一格式进行后训练(生成提示、图像、问题、答案),Mobile-O 同时提升了视觉理解和生成能力。尽管高效,Mobile-O 在性能上与其他统一模型持水平或更优,GenEval 上达 74%,在 Show-O 和 JanusFlow 上的表现分别高出 5% 和 11%,相应速度提升 6 倍和 11 倍。对于视觉理解,Mobile-O 在七个基准测试上的平均表现分别高出 15.3% 和 5.1%。在 iPhone 上仅用约3秒即可处理 512x512 的图像,Mobile-O 建立了在边缘设备上实现实时统一多模态理解与生成的第一个实用框架。我们希望 Mobile-O 将为在完全无需云端依赖的情况下在边缘设备上实现实时统一多模态智能的未来研究提供便利。我们的代码、模型、数据集和移动应用已在 https://amshaker.github.io/Mobile-O/ 上公开。
引用
@article{arxiv.2602.20161,
title = {Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device},
author = {Abdelrahman Shaker and Ahmed Heakl and Jaseel Muhammad and Ritesh Thawkar and Omkar Thawakar and Senmao Li and Hisham Cholakkal and Ian Reid and Eric P. Xing and Salman Khan and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2602.20161},
year = {2026}
}
备注
Project page: https://amshaker.github.io/Mobile-O/