中文

基于互信息最大化的去噪瓶颈用于视频多模态融合

计算与语言 2023-06-01 v3

摘要

视频多模态融合旨在整合视频中的多模态信号(如视觉、音频和文本),以利用多模态内容进行互补预测。然而,与其他图文多模态任务不同,视频具有更长的多模态序列,且在视觉和音频模态中均含有更多冗余与噪声。先前的去噪方法(如遗忘门)在噪声过滤的粒度上较为粗糙,常以丢失关键信息为代价来抑制冗余和噪声信息。因此,我们提出一种去噪瓶颈融合(DBF)模型,用于细粒度视频多模态融合。一方面,我们采用瓶颈机制以受限的感受野过滤噪声与冗余;另一方面,我们利用互信息最大化模块来约束过滤模块,以保留不同模态中的关键信息。我们的DBF模型在涵盖多模态情感分析与多模态摘要任务的多个基准上相较当前最先进的基线取得显著提升,证明该模型能有效从含噪且冗余的视频、音频和文本输入中捕获显著特征。本文代码已公开于 https://github.com/WSXRHFG/DBF。

关键词

引用

@article{arxiv.2305.14652,
  title  = {Denoising Bottleneck with Mutual Information Maximization for Video Multimodal Fusion},
  author = {Shaoxiang Wu and Damai Dai and Ziwei Qin and Tianyu Liu and Binghuai Lin and Yunbo Cao and Zhifang Sui},
  journal= {arXiv preprint arXiv:2305.14652},
  year   = {2023}
}

备注

Accept at ACL2023