基于时空参照的动作检索与高亮
计算机视觉与模式识别
2020-05-20 v1 计算与语言
信息检索
摘要
本文提出一种通过增强当前深度跨模态检索方法来联合检索并时空高亮视频中动作的框架。我们的工作承担了动作高亮这一新任务,其可视化未裁剪视频中动作发生的位置与时间。与聚焦于分类或基于窗口定位的传统动作识别任务相比,动作高亮是一项细粒度任务。利用来自标注字幕的弱监督,我们的框架获取时空相关图并生成与字幕中名词和动词相关的局部嵌入。通过实验,我们表明我们的模型能生成依赖于不同动作的多张图,而传统视觉推理方法至多只能给出单一确定性显著图。此外,在 MSR-VTT 数据集上,我们的模型相较无对齐基线的检索召回率提升了 2–3%。
引用
@article{arxiv.2005.09183,
title = {Retrieving and Highlighting Action with Spatiotemporal Reference},
author = {Seito Kasai and Yuchi Ishikawa and Masaki Hayashi and Yoshimitsu Aoki and Kensho Hara and Hirokatsu Kataoka},
journal= {arXiv preprint arXiv:2005.09183},
year = {2020}
}
备注
Accepted to ICIP 2020