中文

重新思考多模态融合的约束:以弱监督音视频视频解析为例

计算机视觉与模式识别 2021-06-01 v1

摘要

对于多模态任务,一个好的特征提取网络应尽可能多地提取信息,并确保所提取的特征嵌入与其他模态特征嵌入具有优良的相互理解能力。后者在特征融合中往往比前者更为关键。因此,选择最优的特征提取网络搭配是多模态任务中一个非常重要的子问题。现有研究大多忽略该问题或采用穷举方法。本文将此问题建模为一个优化问题,并参考数学中极值转换的通用做法,提出一种将优化问题转化为比较上界问题的方法。与传统方法相比,它降低了时间成本。同时,针对多模态时间序列问题中特征相似度与特征语义相似度不对齐的常见问题,我们借鉴对比学习的思想,提出了一种多模态时间序列对比损失(MTSC)。基于上述问题,我们在音视频视频解析任务中证明了方法的可行性。大量分析验证了我们的方法促进了不同模态特征的融合。

关键词

引用

@article{arxiv.2105.14430,
  title  = {Rethinking the constraints of multimodal fusion: case study in Weakly-Supervised Audio-Visual Video Parsing},
  author = {Jianning Wu and Zhuqing Jiang and Shiping Wen and Aidong Men and Haiying Wang},
  journal= {arXiv preprint arXiv:2105.14430},
  year   = {2021}
}