多模态数据的自适应融合技术
计算与语言
2021-01-27 v2 计算机视觉与模式识别
机器学习
音频与语音处理
摘要
由于多模态数据的异质性,来自视频、语音和文本等多种模态数据的有效融合具有挑战性。在本文中,我们提出旨在有效建模来自不同模态上下文的自适应融合技术。我们不为网络定义确定性的融合操作(如拼接),而是让网络决定“如何”更有效地组合给定的一组多模态特征。我们提出两个网络:1)Auto-Fusion,学习在保留上下文的同时压缩来自不同模态的信息;2)GAN-Fusion,在给定来自互补模态的上下文时对学到的潜空间进行正则化。在多模态机器翻译和情感识别任务上的定量评估表明,我们的轻量级自适应网络比现有方法(其中许多采用大规模的基于Transformer的网络)能更好地建模来自其他模态的上下文。
引用
@article{arxiv.1911.03821,
title = {Adaptive Fusion Techniques for Multimodal Data},
author = {Gaurav Sahu and Olga Vechtomova},
journal= {arXiv preprint arXiv:1911.03821},
year = {2021}
}
备注
Camera-ready version for EACL 2021