弱监督时序文章 grounding
计算机视觉与模式识别
2023-02-27 v2 人工智能
计算与语言
多媒体
摘要
给定一个长而未裁剪的视频与自然语言查询,视频 grounding(VG)旨在时间上定位语义对齐的视频片段。几乎所有现有 VG 工作都持有两个简单但不现实的假设:1)所有查询句子都可在对应视频中 grounding。2)同一视频的所有查询句子总处于相同语义尺度。遗憾的是,这两个假设使当今的 VG 模型无法在实际中工作。例如,在真实世界多模态素材(如新闻文章)中,文章大多数句子无法在其附属视频中 grounding,且它们通常具有丰富的层次关系(即处于不同语义尺度)。为此,我们提出一项新的具挑战性的 grounding 任务:弱监督时序文章 Grounding(WSAG)。具体而言,给定一篇文章与一个相关视频,WSAG 旨在将所有“可 grounding”的句子定位至视频,且这些句子可能处于不同语义尺度。相应地,我们收集了首个 WSAG 数据集以促进该任务:YouwikiHow,其借用了 wikiHow 文章中固有的多尺度描述与丰富的 YouTube 视频。此外,我们提出一种简单而有效的 WSAG 方法 DualMIL,由两级 MIL 损失与单句/跨句约束损失组成。这些训练目标针对这些放宽假设精心设计的。大量消融实验验证了 DualMIL 的有效性。
引用
@article{arxiv.2210.12444,
title = {Weakly-Supervised Temporal Article Grounding},
author = {Long Chen and Yulei Niu and Brian Chen and Xudong Lin and Guangxing Han and Christopher Thomas and Hammad Ayyubi and Heng Ji and Shih-Fu Chang},
journal= {arXiv preprint arXiv:2210.12444},
year = {2023}
}
备注
EMNLP 2022, https://github.com/zjuchenlong/WSAG