中文

DeepMLF:面向深度融合的多模态语言模型

计算与语言 2025-04-16 v1 人工智能

摘要

尽管在多模态情感分析 (MSA) 中广泛研究了多模态融合,但融合深度和模态容量分配的作用仍未得到充分探索。本文将融合深度、可扩展性和专用模态容量视为有效融合的主要因素。我们引入 DeepMLF,一款针对深度融合设计的新型多模态语言模型 (LM),配备可学习的标记。DeepMLF 利用音视频编码器和预训练解码器 LM,通过跨层融合音视频信息。我们将可学习标记附加到 LM,以:1)以受控方式捕获模态交互,2)为每个模态保留独立信息流。这些融合标记通过 LM 中的因果自注意力收集语言信息,并通过跨注意力 MM 块与音视频信息集成。作为专用模态容量,该设计使跨多个层的渐进式融合成为可能,为融合过程提供深度。我们的训练配方结合模态特定损失和语言建模损失,解码器 LM 被任务预测 ground truth 情感极性。DeepMLF 在三个具有不同数据集特征的 MSA 基准测试中实现了最先进的性能。我们的实验结果确认更深的融合导致更好的性能,最佳融合深度 (5-7) 超过了现有方法。此外,我们对融合标记的数量进行分析,发现小标记集 (\sim20) 能实现最佳性能。我们通过音视频编码器初始化实验检视了表示学习顺序 (融合课程) 的重要性。我们的消融研究证明了所提出的融合设计和门控的优越性,并对 DeepMLF 的可扩展性到 LLM、以及每个训练目标和嵌入正则化的影响进行了全面检视。

关键词

引用

@article{arxiv.2504.11082,
  title  = {DeepMLF: Multimodal language model with learnable tokens for deep fusion in sentiment analysis},
  author = {Efthymios Georgiou and Vassilis Katsouros and Yannis Avrithis and Alexandros Potamianos},
  journal= {arXiv preprint arXiv:2504.11082},
  year   = {2025}
}

备注

Preprint