中文

外部知识对话视频(OKCV)数据集——视频对话

计算机视觉与模式识别 2025-06-12 v1 人工智能 计算与语言

摘要

在外部知识视觉问答(OK-VQA)中,模型必须识别图像中的相关视觉信息,并结合外部知识来准确回答问题。将这一任务扩展到基于视频的视觉引导对话设置中,对话模型必须同时识别随时间变化的相关视觉细节,并回答所需信息不一定存在于视觉信息中的问题。此外,必须考虑整体对话的上下文以进行后续对话。为探索这一任务,我们引入了一个包含 2,017 个视频、5,986 个人工标注对话、由 40,954 个交错对话轮次组成的数据集。虽然对话上下文在特定视频片段中具有视觉引导性,但问题进一步要求不存在于视觉信息中的外部知识。因此,模型不仅必须识别相关的视频片段,还必须利用外部知识在对话中进行交流。我们进一步提供了在该数据集上评估的几个基线,并展示了与该任务相关的未来挑战。该数据集已公开发布:https://github.com/c-patsch/OKCV。

关键词

引用

@article{arxiv.2506.09953,
  title  = {Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos},
  author = {Benjamin Reichman and Constantin Patsch and Jack Truxal and Atishay Jain and Larry Heck},
  journal= {arXiv preprint arXiv:2506.09953},
  year   = {2025}
}