面向视频语料库时刻检索的模态特定伪查询生成
计算与语言
2022-10-25 v1
摘要
视频语料库时刻检索(VCMR)是一项利用自然语言查询从大规模视频语料库中检索最相关视频时刻的任务。对于叙事类视频(如电视剧或电影),对时间动态的全局理解以及多模态推理至关重要。已有研究取得了令人鼓舞的结果;然而,它们依赖于昂贵的 VCMR 查询标注,即对应的时刻区间。为克服该问题,我们提出了一种自监督学习框架:模态特定伪查询生成网络(MPGN)。首先,MPGN 通过基于字幕的时刻采样筛选候选时间时刻。然后,它利用所选时间时刻中的视觉与文本信息生成伪查询。通过伪查询中的多模态信息,我们表明 MPGN 无需任何显式标注即可成功学习定位视频语料库时刻。我们在 TVR 数据集上验证了 MPGN 的有效性,与有监督模型及无监督设定模型相比均取得了具有竞争力的结果。
引用
@article{arxiv.2210.12617,
title = {Modal-specific Pseudo Query Generation for Video Corpus Moment Retrieval},
author = {Minjoon Jung and Seongho Choi and Joochan Kim and Jin-Hwa Kim and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:2210.12617},
year = {2022}
}
备注
Accepted by EMNLP 2022 main conference