中文

LGDN:用于视频-语言建模的语言引导去噪网络

计算机视觉与模式识别 2022-12-06 v3 人工智能 多媒体

摘要

随着网络视频的快速增长,视频-语言建模引起了广泛关注。大多数现有方法假设视频帧与文本描述在语义上相关,并聚焦于视频级视频-语言建模。然而,该假设常因以下两点失效:(1)视频内容语义丰富,难以用单一视频级描述覆盖所有帧;(2)原始视频通常含有噪声/无意义信息(如风景镜头、转场或预告片)。尽管近期若干工作部署注意力机制以缓解此问题,无关/噪声信息仍使其极难解决。为克服该挑战,我们提出一种高效且有效的模型,称为语言引导去噪网络(LGDN),用于视频-语言建模。与多数利用所有提取视频帧的现有方法不同,LGDN在语言监督下动态过滤掉未对齐或冗余的帧,每视频仅保留2--4个显著帧用于跨模态词元级对齐。在五个公开数据集上的大量实验表明,我们的LGDN大幅优于现有最优方法。我们还提供了详细的消融研究,以揭示解决噪声问题的关键重要性,期望启发未来的视频-语言工作。

关键词

引用

@article{arxiv.2209.11388,
  title  = {LGDN: Language-Guided Denoising Network for Video-Language Modeling},
  author = {Haoyu Lu and Mingyu Ding and Nanyi Fei and Yuqi Huo and Zhiwu Lu},
  journal= {arXiv preprint arXiv:2209.11388},
  year   = {2022}
}

备注

Accepted by NeurIPS2022