多模态模型架构的演化
人工智能
2024-05-29 v1 计算与语言
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
本工作独特地识别并刻画了当代多模态领域中四种常见的多模态模型架构模式。通过按架构类型系统性分类模型,有助于监控多模态领域的发展进展。与最近几篇概览论文不同,本研究对架构细节进行全面探索,并识别出四种特定的架构类型。这些类型通过各自将多模态输入集成到深度神经网络模型中的方法进行区分。前两种类型(Type A 和 Type B)在模型内部深度融合多模态输入,而后两种类型(Type C 和 Type D)在输入阶段实现早期融合。Type-A 采用标准交叉注意力,而 Type-B 使用专为模态融合设计的自定义层。另一方面,Type-C 使用模态特定编码器,而 Type-D 利用标记器在模型输入阶段处理各模态。识别出的架构类型有助于监控 任意-任意 多模态模型的开发。值得注意的是,Type-C 和 Type-D 目前在构建 任意-任意 多模态模型方面受到青睐。Type-C 作为一种非标记化多模态模型架构,正在成为 Type-D(采用输入标记化技术)的可行替代方案。为帮助模型选择,本工作基于数据与计算需求、架构复杂度、可扩展性、添加模态的简便性、训练目标以及 任意-任意 多模态生成能力等因素,概述了每种架构类型的优势与不足。
引用
@article{arxiv.2405.17927,
title = {The Evolution of Multimodal Model Architectures},
author = {Shakti N. Wadekar and Abhishek Chaurasia and Aman Chadha and Eugenio Culurciello},
journal= {arXiv preprint arXiv:2405.17927},
year = {2024}
}
备注
30 pages, 6 tables, 7 figures