中文

如何弥合模态间的鸿沟:多模态大型语言模型综述

计算与语言 2025-01-09 v3 人工智能 计算机视觉与模式识别 多媒体

摘要

我们探索多模态大型语言模型(MLLMs),其集成了如 GPT-4 等 LLM 以处理包括文本、图像、音频等在内的多模态数据。MLLMs 展现出生成图像字幕和回答基于图像的问题等能力,弥合了通往真实世界人机交互的鸿沟,并暗示了通往通用人工智能的潜在路径。然而,MLLMs 在解决多模态数据中的语义鸿沟方面仍面临挑战,这可能导致错误输出,对社会构成潜在风险。选择合适的模态对齐方法至关重要,因为不当的方法可能需要更多参数而无显著性能提升。本文旨在探索 LLMs 的模态对齐方法及其当前能力。实现有效的模态对齐可帮助 LLMs 解决环境问题并增强可访问性。本研究综述了现有的 MLLMs 模态对齐方法,将其分为四类:(1)多模态转换器,将数据转换为 LLM 可理解的格式;(2)多模态感知器,改进 LLM 感知不同类型数据的方式;(3)工具学习,利用外部工具将数据转换为通用格式(通常为文本);(4)数据驱动方法,教 LLM 在数据集内理解特定数据类型。

关键词

引用

@article{arxiv.2311.07594,
  title  = {How to Bridge the Gap between Modalities: Survey on Multimodal Large Language Model},
  author = {Shezheng Song and Xiaopeng Li and Shasha Li and Shan Zhao and Jie Yu and Jun Ma and Xiaoguang Mao and Weimin Zhang},
  journal= {arXiv preprint arXiv:2311.07594},
  year   = {2025}
}

备注

Accepted by TKDE