中文

编码与控制长视频问答中的全局语义

计算机视觉与模式识别 2024-10-08 v3 人工智能

摘要

有效寻找长视频的答案对于构建视频问答(videoQA)系统至关重要。先前的方法自适应地从长视频中选择帧和区域以节省计算量。然而,这无法对整个视频序列进行推理,导致性能次优。为了解决这个问题,我们将状态空间层(SSL)引入多模态Transformer,以有效整合视频的全局语义,从而减轻帧和区域选择模块导致的视频信息损失。我们的SSL包含一个门控单元,能够控制全局语义流入视觉表示。为了进一步增强可控性,我们引入了一个跨模态组合一致性(C^3)目标,鼓励全局语义与问题对齐。为了严格评估长视频问答能力,我们构建了两个新的基准Ego-QA和MAD-QA,其视频长度分别为17.5分钟和1.9小时。大量实验证明了我们的框架在这些新数据集以及现有数据集上的优越性。代码、模型和数据已在https://nguyentthong.github.io/Long_form_VideoQA提供。

关键词

引用

@article{arxiv.2405.19723,
  title  = {Encoding and Controlling Global Semantics for Long-form Video Question Answering},
  author = {Thong Thanh Nguyen and Zhiyuan Hu and Xiaobao Wu and Cong-Duy T Nguyen and See-Kiong Ng and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2405.19723},
  year   = {2024}
}

备注

Accepted to the main EMNLP 2024 conference