中文

NaQ:利用叙述作为查询来监督情景记忆

计算机视觉与模式识别 2023-03-28 v2

摘要

用自然语言查询(NLQ)搜索长第一视角视频在增强现实和机器人技术中有着引人注目的应用,其中对一个人(智能体)之前所见一切内容的流畅索引可以增强人类记忆并按需呈现相关信息。然而,该学习问题的结构化性质(自由形式文本查询输入、局部化视频时间窗口输出)及其大海捞针的性质使其在技术上具有挑战性且监督成本高昂。我们引入了叙述即查询(NaQ),一种数据增强策略,将标准视频-文本叙述转换为视频查询定位模型的训练数据。在 Ego4D 基准上验证我们的想法,我们发现它在实践中具有巨大影响。NaQ 以显著幅度改进了多个顶尖模型(甚至使其准确率翻倍),并取得了迄今为止 Ego4D NLQ 挑战上的最佳结果,在 CVPR 和 ECCV 2022 竞赛中完胜所有挑战赛获胜者,并登顶当前公开排行榜。除了在 NLQ 上达到 SOTA 外,我们还展示了我们方法的独特性质,例如执行零样本和少样本 NLQ 的能力,以及在关于长尾对象类别的查询上改进的性能。代码与模型:{\small\url{http://vision.cs.utexas.edu/projects/naq}}。

关键词

引用

@article{arxiv.2301.00746,
  title  = {NaQ: Leveraging Narrations as Queries to Supervise Episodic Memory},
  author = {Santhosh Kumar Ramakrishnan and Ziad Al-Halah and Kristen Grauman},
  journal= {arXiv preprint arXiv:2301.00746},
  year   = {2023}
}

备注

13 pages, 7 figures, appearing in CVPR 2023