从长期噪声视频中学习多粒度对应关系
计算机视觉与模式识别
2024-01-31 v1
摘要
现有的视频-语言研究主要集中于学习短视频片段,由于建模长视频的计算成本过高,长期时间依赖性很少被探索。为了解决这个问题,一种可行的方案是学习视频片段与字幕之间的对应关系,然而这不可避免地会遇到多粒度噪声对应(MNC)问题。具体而言,MNC 指的是片段-字幕错位(粗粒度)和帧-词错位(细粒度),这阻碍了时间学习与视频理解。在本文中,我们提出了噪声鲁棒时间最优传输(NOise Robust Temporal Optimal traNsport, Norton),在统一的最优传输(OT)框架内解决 MNC 问题。简而言之,Norton 利用视频-段落和片段-字幕对比损失基于 OT 捕获长期依赖关系。为了解决视频-段落对比中的粗粒度错位,Norton 通过可对齐提示桶过滤掉不相关的片段和字幕,并基于传输距离重新对齐异步的片段-字幕对。为了解决细粒度错位,Norton 引入 soft-maximum 算子来识别关键词和关键帧。此外,Norton 通过用 OT 分配纠正对齐目标,利用了片段-字幕对比中潜在的假负样本,以确保精确的时间建模。在视频检索、视频问答(videoQA)和动作分割上的大量实验验证了我们方法的有效性。代码可在 https://lin-yijie.github.io/projects/Norton 获取。
引用
@article{arxiv.2401.16702,
title = {Multi-granularity Correspondence Learning from Long-term Noisy Videos},
author = {Yijie Lin and Jie Zhang and Zhenyu Huang and Jia Liu and Zujie Wen and Xi Peng},
journal= {arXiv preprint arXiv:2401.16702},
year = {2024}
}
备注
Accepted by ICLR 2024 (oral)