TG-VQA:视频问答的三元博弈
计算机视觉与模式识别
2023-05-19 v2 多媒体
摘要
视频问答旨在通过对视频内容内部对齐语义进行推理来回答关于视频内容的问题。然而,由于严重依赖人类指令(即标注或先验),当前基于对比学习的 VideoQA 方法在进行细粒度视觉-语言对齐时仍具挑战。在本工作中,我们创新性地借助博弈论,其可模拟多个参与者间具有特定交互策略的复杂关系(例如将视频、问题和答案作为三元参与者),以实现 VideoQA 任务的细粒度对齐。具体而言,我们精心设计了针对 VideoQA 特性的 VideoQA 专用交互策略,能够从数学上生成细粒度视觉-语言对齐标签而无需大量标注工作。我们的 TG-VQA 在长期和短期 VideoQA 数据集上以较大幅度(超过 5%)优于现有最先进方法,验证了其有效性与泛化能力。得益于博弈论交互的指导,我们的模型在有限数据(10^4 个视频)上即实现良好收敛,超越了大多数在大规模数据(10^7 个视频)上预训练的模型。
引用
@article{arxiv.2305.10049,
title = {TG-VQA: Ternary Game of Video Question Answering},
author = {Hao Li and Peng Jin and Zesen Cheng and Songyang Zhang and Kai Chen and Zhennan Wang and Chang Liu and Jie Chen},
journal= {arXiv preprint arXiv:2305.10049},
year = {2023}
}
备注
IJCAI 2023