ViSeRet:一种通过细粒度视频分割实现时刻检索的简洁而有效方法
计算机视觉与模式识别
2021-10-13 v2 人工智能
计算与语言
摘要
视频-文本检索具有许多现实应用,如媒体分析、监控与机器人。本文给出 ICCV VALUE Challenge 2021 视频检索赛道的第一名方案。我们提出一种简洁而有效的方法,通过仅利用在视频检索任务上训练的模型,联合处理两个视频-文本检索任务(视频检索与视频语料时刻检索)。此外,我们创建了一个集成模型,在 VALUE Challenge 中提出的全部四个数据集(TVr、How2r、YouCook2r 和 VATEXr)上取得了新的最先进性能。
引用
@article{arxiv.2110.05146,
title = {ViSeRet: A simple yet effective approach to moment retrieval via fine-grained video segmentation},
author = {Aiden Seungjoon Lee and Hanseok Oh and Minjoon Seo},
journal= {arXiv preprint arXiv:2110.05146},
year = {2021}
}