中文

FriendsQA:面向故事视频的细粒度主题分类的大规模深度视频理解数据集

计算机视觉与模式识别 2024-12-24 v1

摘要

视频问答(VideoQA)旨在根据给定视频回答自然语言问题。虽然现有模型在事实型VideoQA任务中表现良好,但在深度视频理解(DVU)任务中仍面临挑战,后者侧重于故事视频。与事实型视频相比,故事视频最显著的特征是由复杂互动和核心故事主题(包括角色、动作和地点)的长期演变构成的情节线索。理解这些主题需要模型具备DVU能力。然而,现有DVU数据集很少按这些故事主题组织问题,导致难以全面评估VideoQA模型处理复杂情节线索的DVU能力。此外,这些数据集的question数量和视频长度受手工构建数据集的高劳动力成本限制。本文提出了基于大语言模型的多智能体协作框架StoryMind,用于自动生成新的大规模DVU数据集。数据集FriendsQA源自著名的情景喜剧Friends,平均集长度达1358秒,包含44.6K个问题,均匀分布在14个细粒度主题上。最后,我们在FriendsQA数据集上对10个最先进的VideoQA模型进行了全面实验。

关键词

引用

@article{arxiv.2412.17022,
  title  = {FriendsQA: A New Large-Scale Deep Video Understanding Dataset with Fine-grained Topic Categorization for Story Videos},
  author = {Zhengqian Wu and Ruizhe Li and Zijun Xu and Zhongyuan Wang and Chunxia Xiao and Chao Liang},
  journal= {arXiv preprint arXiv:2412.17022},
  year   = {2024}
}

备注

Accepted by AAAI 2025