中文

用于视频问答的自上而下活动表征学习

计算机视觉与模式识别 2024-09-16 v1 人工智能 计算与语言

摘要

捕捉复杂的层次化人类活动,从原子动作(例如,拿起一个礼物、移动到沙发、拆开礼物)到情境事件(例如,庆祝圣诞节),对于实现高性能的视频问答 (VideoQA) 至关重要。近期的工作扩展了多模态模型(例如 CLIP、LLaVA)以处理连续视频序列,增强了模型的时间推理能力。然而,这些方法通常无法捕捉可分解为在相对长期序列中非连续分布的多个原子动作的情境事件。在本文中,为了利用 CLIP 模型的空间视觉上下文表征能力,以获取视频中情境事件方面的非连续视觉表征,我们将长期视频序列转换为空间图像域,并为 VideoQA 任务微调多模态模型 LLaVA。我们的方法在 STAR 任务上取得了有竞争力的性能,特别是在 NExTQA 任务上以 78.4% 的准确率超过了当前 SOTA 分数 2.8 个百分点。

关键词

引用

@article{arxiv.2409.07748,
  title  = {Top-down Activity Representation Learning for Video Question Answering},
  author = {Yanan Wang and Shuichiro Haruta and Donghuo Zeng and Julio Vizcarra and Mori Kurokawa},
  journal= {arXiv preprint arXiv:2409.07748},
  year   = {2024}
}

备注

presented at MIRU2024