从特定MLLM到全模态MLLM:多模态对齐的MLLM综述
人工智能
2025-03-05 v3 计算与语言
机器学习
摘要
为了应对现实场景中的复杂任务,越来越多的研究者关注Omni-MLLMs,其目标是实现全模态理解和生成。超越任何特定非语言模态的限制,Omni-MLLMs将各种非语言模态映射到LLMs的嵌入空间,并在单个模型中实现任意模态组合的交互和理解。在本文中,我们系统地研究了相关研究,并对Omni-MLLMs进行了全面综述。具体来说,我们首先解释了Omni-MLLMs用于统一多模态建模的四个核心组件,并进行了细致的分类,提供了新颖的视角。然后,我们介绍了通过两阶段训练实现的有效集成,并讨论了相应的数据集和评估。此外,我们总结了当前Omni-MLLMs的主要挑战并概述了未来方向。我们希望本文能为初学者提供入门介绍,并促进相关研究的进展。资源已在https://github.com/threegold116/Awesome-Omni-MLLMs公开。
引用
@article{arxiv.2412.11694,
title = {From Specific-MLLMs to Omni-MLLMs: A Survey on MLLMs Aligned with Multi-modalities},
author = {Shixin Jiang and Jiafeng Liang and Jiyuan Wang and Xuan Dong and Heng Chang and Weijiang Yu and Jinhua Du and Ming Liu and Bing Qin},
journal= {arXiv preprint arXiv:2412.11694},
year = {2025}
}
备注
35 pages