高模态多模态 Transformer:量化模态与交互异质性用于高模态表示学习
机器学习
2023-06-29 v4 人工智能
计算与语言
计算机视觉与模式识别
多媒体
摘要
许多现实世界问题天然是多模态的,从人类交流所用的口语、手势和副语言,到机器人上的力、本体感知和视觉传感器。尽管多模态学习兴趣激增,这些方法聚焦于语言、视觉和音频中一小部分模态。为加速向多样且研究不足的模态的泛化,本文研究涉及大量多样模态的高模态场景下的高效表示学习。由于为每个新模态添加新模型变得极其昂贵,一个关键技术挑战是异质性量化:我们如何度量哪些模态编码相似信息与交互,从而允许与先前模态参数共享?本文提出两个用于异质性量化的新信息论度量:(1)模态异质性通过度量从 X1 可转移到 X2 的信息量,研究两个模态 {X1,X2} 的相似度;(2)交互异质性通过度量从融合 {X1,X2} 可转移到 {X3,X4} 的信息量,研究模态对 {X1,X2}、{X3,X4} 交互的相似度。我们展示了这两个提议度量的重要性,作为自动优先融合含独特信息或交互的模态的手段。结果是一个单一模型 HighMMT,可扩展至 10 种模态(文本、图像、音频、视频、传感器、本体感知、语音、时间序列、集合和表格)及来自 5 个研究领域的 15 个任务。HighMMT 不仅在性能与效率权衡上优于先前方法,还展示了关键的缩放行为:性能随每添加一个模态持续提升,并在微调时迁移至全新模态与任务。
引用
@article{arxiv.2203.01311,
title = {High-Modality Multimodal Transformer: Quantifying Modality & Interaction Heterogeneity for High-Modality Representation Learning},
author = {Paul Pu Liang and Yiwei Lyu and Xiang Fan and Jeffrey Tsaw and Yudong Liu and Shentong Mo and Dani Yogatama and Louis-Philippe Morency and Ruslan Salakhutdinov},
journal= {arXiv preprint arXiv:2203.01311},
year = {2023}
}
备注
TMLR 2023, Code available at https://github.com/pliang279/HighMMT