Mirasol3B:面向时间对齐与上下文模态的多模态自回归模型
计算机视觉与模式识别
2024-04-05 v3
摘要
多模态学习的主要挑战之一是需要组合异构模态(如视频、音频、文本)。例如,视频与音频的获取速率远高于文本且大致时间对齐。它们常与文本不同步,文本作为全局上下文出现,如标题或描述。此外,视频与音频输入体量更大,并随视频长度增加而增长,这自然需要更多针对这些模态的计算资源,并使长程依赖建模更困难。我们在此解耦多模态建模,将其划分为独立、专注的自回归模型,依据模态特性处理输入。我们提出一个名为Mirasol3B的多模态模型,由处理时间同步模态(音频与视频)的自回归组件,以及处理未必时间对齐但仍有顺序的上下文模态的自回归组件构成。为解决视频-音频输入的长序列问题,我们进一步将视频与音频序列划分为连续片段并自回归地处理其表示。为此,我们提出一种Combiner机制,在时间段内联合建模音频-视频信息。Combiner学习从原始时空信号提取音频与视频特征,然后融合这些特征以生成每片段紧凑而具表现力的表示。我们的方法在成熟多模态基准上达到最先进水平,优于大得多的模型。它通过学习紧凑表示、控制音频-视频特征表示的序列长度并建模其时间依赖,有效应对媒体输入的高计算需求。
引用
@article{arxiv.2311.05698,
title = {Mirasol3B: A Multimodal Autoregressive model for time-aligned and contextual modalities},
author = {AJ Piergiovanni and Isaac Noble and Dahun Kim and Michael S. Ryoo and Victor Gomes and Anelia Angelova},
journal= {arXiv preprint arXiv:2311.05698},
year = {2024}
}
备注
CVPR 2024