用于视频字幕的视觉常识感知表示网络
计算机视觉与模式识别
2022-11-18 v1
摘要
为视频生成连续描述,即视频字幕,需要充分利用视觉表示及生成过程。现有视频字幕方法侧重于探索时空表示及其关系以产生推断。然而,此类方法仅利用了视频本身包含的表层关联,未考虑视频数据集中存在的内在视觉常识知识,这可能阻碍其知识认知以推理准确描述的能力。为解决该问题,我们提出一种简洁而有效的方法,称为视觉常识感知表示网络(VCRN),用于视频字幕。具体而言,我们构建了一个即插即用组件视频词典,通过将整个数据集中所有视频特征聚类为多个聚类中心而获得,无需额外标注。每个中心隐式表示视频域中的一种视觉常识概念,其被用于我们提出的视觉概念选择(VCS)中以获取视频相关概念特征。接下来,提出概念集成生成(CIG)以增强字幕生成。在 MSVD、MSR-VTT 和 VATEX 三个公开视频字幕基准上的大量实验表明,我们的方法达到了最先进性能,证明了方法的有效性。此外,我们的方法被集成到现有的视频问答方法中并提升了其性能,进一步展示了我们方法的泛化性。源代码已发布于 https://github.com/zchoi/VCRN。
引用
@article{arxiv.2211.09469,
title = {Visual Commonsense-aware Representation Network for Video Captioning},
author = {Pengpeng Zeng and Haonan Zhang and Lianli Gao and Xiangpeng Li and Jin Qian and Heng Tao Shen},
journal= {arXiv preprint arXiv:2211.09469},
year = {2022}
}