用于噪声环境下多模态表征学习的广义专家乘积方法
计算机视觉与模式识别
2022-11-08 v1 人工智能
机器学习
摘要
现实世界的应用或场景涉及不同模态(如视频、语音、文本)之间的交互。为了自动处理多模态信息并将其用于终端应用,多模态表征学习(MRL)近年来成为一个活跃的研究领域。MRL 涉及从异构源中学习可靠且鲁棒的表征并对其进行融合。然而在实践中,从不同来源获取的数据通常含有噪声。在某些极端情况下,大幅度的噪声会完全改变数据的语义,导致并行多模态数据的不一致。本文中,我们提出一种通过广义专家乘积技术在噪声环境下进行多模态表征学习的新方法。在所提方法中,我们为每个模态训练独立的网络以评估来自该模态的信息的可信度,随后在估计联合分布时动态调节各模态的贡献。我们在来自两个不同领域的两个具有挑战性的基准上评估了我们的方法:多模态 3D 手部姿态估计与多模态手术视频分割。我们在两个基准上均达到了最先进的性能。我们广泛的定量与定性评估显示了该方法相较于先前方法的优势。
引用
@article{arxiv.2211.03587,
title = {Generalized Product-of-Experts for Learning Multimodal Representations in Noisy Environments},
author = {Abhinav Joshi and Naman Gupta and Jinang Shah and Binod Bhattarai and Ashutosh Modi and Danail Stoyanov},
journal= {arXiv preprint arXiv:2211.03587},
year = {2022}
}
备注
11 Pages, Accepted at ICMI 2022 Oral