中文

ICCV 2023 感知测试挑战赛 2023 -- 任务 6 -- 基于 grounding 的视频问答解决方案

计算机视觉与模式识别 2024-07-03 v1 机器学习

摘要

本文介绍了一种基于 grounding 的视频问答解决方案。我们的研究发现,视频问答的固定官方基线方法包含两个主要步骤:视觉 grounding 和目标跟踪。然而,在初始步骤中,选取的帧可能缺乏清晰可辨的目标对象。此外,单张图像无法解决此类问题:“追踪第一个时间从中倒出物品的容器”。为此,我们提出了另一种两阶段方法:(1) 首先,我们利用 VALOR 模型基于视频信息回答问题。(2) 将回答后的问题与其相应的答案拼接。最后,我们采用 TubeDETR 为目标生成边界框。

关键词

引用

@article{arxiv.2407.01907,
  title  = {The Solution for the ICCV 2023 Perception Test Challenge 2023 -- Task 6 -- Grounded videoQA},
  author = {Hailiang Zhang and Dian Chao and Zhihao Guan and Yang Yang},
  journal= {arXiv preprint arXiv:2407.01907},
  year   = {2024}
}