Ask2Loc:通过提问学习定位指令性视觉答案
计算机视觉与模式识别
2025-04-24 v2 人工智能
人机交互
摘要
在指令视频中定位特定片段是获取指导性知识的有效方式。一般而言,获取用于 verbal explanation 和 visual demonstration 的视频片段的任务称为视觉答案定位(VAL)。然而,用户在使用系统时,往往需要多次交互才能获得符合其期望的答案。在这些交互期间,人类通过对视频内容提出问题来深化对内容的理解,从而准确地识别位置。因此,我们提出了新的任务,称为 In-VAL,通过模拟人类与视频之间的多次交互来实现获取视觉答案的过程。In-VAL 任务需要解决几个语义间隙问题,包括 1) 输入问题中用户意图的模糊性,2) 视频字幕语言的不完整性,3) 视频片段内容的碎片化。为了解决这些问题,我们提出了 Ask2Loc,通过提问来解决 In-VAL 的框架。它包括三个关键模块:1) 一个聊天模块来细化初始问题并揭示清晰意图,2) 一个重写模块来生成流畅的语言并创建完整的描述,3) 一个搜索模块来扩大局部上下文并提供集成内容。我们在三个重构的 In-VAL 数据集上进行了大量实验。与传统的端到端方法和两阶段方法相比,我们提出的 Ask2Loc 在 In-VAL 任务上可提高最高 14.91(mIoU) 的性能。我们的代码和数据集可在 https://github.com/changzong/Ask2Loc 访问。
引用
@article{arxiv.2504.15918,
title = {Ask2Loc: Learning to Locate Instructional Visual Answers by Asking Questions},
author = {Chang Zong and Bin Li and Shoujun Zhou and Jian Wan and Lei Zhang},
journal= {arXiv preprint arXiv:2504.15918},
year = {2025}
}
备注
16 pages, 8 figures