中文

多模态大语言模型及其微调:视觉、语言、传感器、音频及其他

计算与语言 2024-10-10 v1

摘要

本教程探讨了多模态预训练和大模型的最新进展,这些模型能够整合和处理多种数据形式,如文本、图像、音频和视频。参与者将理解多模态的基本概念、多模态研究的演变以及这些模型解决的关键技术挑战。我们将涵盖最新的多模态数据集和预训练模型,包括超越视觉和语言的模型。此外,本教程将深入探讨多模态大模型的复杂性以及用于优化特定任务性能的指令微调策略。动手实验环节将提供使用最先进多模态模型的实践经验,展示视觉叙事和视觉问答等实际应用。本教程旨在为研究人员、从业者和新手提供利用多模态AI的知识和技能。ACM Multimedia 2024是举办此教程的理想场所,与我们对理解多模态预训练和大语言模型及其微调机制的目标完美契合。

关键词

引用

@article{arxiv.2410.05608,
  title  = {Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond},
  author = {Soyeon Caren Han and Feiqi Cao and Josiah Poon and Roberto Navigli},
  journal= {arXiv preprint arXiv:2410.05608},
  year   = {2024}
}

备注

Accepted at ACM-MM 2024