中文

模态到模态翻译:一种用于多模态融合的对抗表示学习与图融合网络

计算机视觉与模式识别 2020-12-11 v4 机器学习 多媒体

摘要

为多种模态学习联合嵌入空间对多模态融合至关重要。主流模态融合方法未能实现该目标,留下了严重制约跨模态融合的模态鸿沟。本文提出一种新颖的对抗式编码器-解码器-分类器框架以学习模态不变嵌入空间。由于各模态的分布本质不同,为缩小模态鸿沟,我们通过各自编码器利用对抗训练将源模态的分布翻译为目标模态的分布。此外,我们引入重构损失与分类损失对嵌入空间施加额外约束。随后,我们使用层次图神经网络融合编码后的表示,该网络在多阶段中显式探索单模态、双模态与三模态交互。我们的方法在多个数据集上取得当前最优性能。对所学嵌入的可视化表明,本方法学习的联合嵌入空间具有判别性。代码见:\url{https://github.com/TmacMai/ARGF_multimodal_fusion}

关键词

引用

@article{arxiv.1911.07848,
  title  = {Modality to Modality Translation: An Adversarial Representation Learning and Graph Fusion Network for Multimodal Fusion},
  author = {Sijie Mai and Haifeng Hu and Songlong Xing},
  journal= {arXiv preprint arXiv:1911.07848},
  year   = {2020}
}

备注

Accepted by AAAI-2020; code is available at: https://github.com/TmacMai/ARGF_multimodal_fusion