中文

AssistSR:面向个人AI助手的任务导向视频片段检索

计算机视觉与模式识别 2022-10-11 v4

摘要

手机和 AR 眼镜上的个人 AI 助手能够协助我们解决日常生活中的问题,例如“如何调整这块手表的日期?”和“如何设置它的加热时长?(同时指向一个烤箱)”,这仍然是一个梦想。传统任务(即视频问答、视频检索、时刻定位)中使用的查询通常是事实性的且基于纯文本。相比之下,我们提出了一项名为任务导向问题驱动视频片段检索(TQVSR)的新任务。我们的每个问题都是一个图像-框-文本查询,关注日常物品的可用性,并期望从教学视频转录片段语料库中检索出相关的回答片段。为了支持对 TQVSR 任务的研究,我们构建了一个名为 AssistSR 的新数据集。我们设计了新颖的指南来创建高质量样本。该数据集包含关于来自各种日常用品教学视频的 1.6k 个视频片段的 3.2k 个多模态问题。为了解决 TQVSR,我们开发了一个简单而有效的模型,称为双多模态编码器(DME),该模型显著优于几种基线方法,同时在未来仍有很大的改进空间。此外,我们提供了详细的消融分析。代码和数据可在 \url{https://github.com/StanLei52/TQVSR} 获取。

关键词

引用

@article{arxiv.2111.15050,
  title  = {AssistSR: Task-oriented Video Segment Retrieval for Personal AI Assistant},
  author = {Stan Weixian Lei and Difei Gao and Yuxuan Wang and Dongxing Mao and Zihan Liang and Lingmin Ran and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2111.15050},
  year   = {2022}
}

备注

20 pages, 12 figures