基于图像查询的视频中未见活动定位
计算机视觉与模式识别
2019-07-01 v1 信息检索
摘要
未修剪视频中的动作定位是视频理解领域的一个重要课题。然而,现有的动作定位方法局限于预定义的一组动作,无法定位未见过的活动。为此,我们考虑一项新任务:通过图像查询定位视频中的未见活动,命名为基于图像的活动定位(Image-Based Activity Localization)。该任务面临三个固有挑战:(1)如何消除图像查询中语义非本质内容的影响;(2)如何处理不准确图像查询的模糊定位;(3)如何确定目标片段的精确边界。我们进而提出一种新颖的自注意力交互定位器,以端到端方式检索未见活动。具体而言,我们首先设计一种带相对位置编码的区域自注意力方法,以学习细粒度的图像区域表示。然后,我们采用局部 transformer 编码器来构建图像与视频内容的多步融合与推理。接下来,我们采用一种顺序敏感定位器直接检索目标片段。此外,我们通过重组 ActivityNet 数据集构建了一个新数据集 ActivityIBAL。大量实验表明了我们所提方法的有效性。
引用
@article{arxiv.1906.12165,
title = {Localizing Unseen Activities in Video via Image Query},
author = {Zhu Zhang and Zhou Zhao and Zhijie Lin and Jingkuan Song and Deng Cai},
journal= {arXiv preprint arXiv:1906.12165},
year = {2019}
}
备注
Accepted by IJCAI 2019 as a poster paper