中文

基于交换的多模态融合与 Transformer

计算机视觉与模式识别 2023-09-06 v1 人工智能

摘要

本文研究多模态融合问题。近期提出的基于交换的方法用于视觉-视觉融合,旨在将一模态学到的嵌入交换至另一模态。然而,多数方法将多模态输入投影至不同低维空间,无法应用于序列输入数据。为解决这些问题,本文提出一种新颖的基于交换的多模态融合模型 MuSE,基于 Transformer 用于文本-视觉融合。我们首先用两个编码器将多模态输入分别映射至不同低维空间,随后用两个解码器正则化嵌入并将其拉入同一空间;两解码器分别通过图像描述生成任务与文本到图像生成任务捕获文本与图像间关联。进一步,基于正则化嵌入,我们提出 CrossTransformer,以两个参数共享的 Transformer 编码器为骨干模型在多模态间交换知识:其先在浅层学习输入全局上下文信息,之后通过选取一模态中一定比例 token 并将其嵌入替换为另一模态嵌入均值来执行模态间交换。我们在多模态命名实体识别任务与多模态情感分析任务上开展充分实验评估 MuSE 性能,结果显示 MuSE 优于其他对比方法。代码与数据见 https://github.com/RecklessRonan/MuSE。

关键词

引用

@article{arxiv.2309.02190,
  title  = {Exchanging-based Multimodal Fusion with Transformer},
  author = {Renyu Zhu and Chengcheng Han and Yong Qian and Qiushi Sun and Xiang Li and Ming Gao and Xuezhi Cao and Yunsen Xian},
  journal= {arXiv preprint arXiv:2309.02190},
  year   = {2023}
}