面向视频理解与知识嵌入的统一模型及异质知识图数据集
计算机视觉与模式识别
2023-04-04 v2
摘要
视频理解是短视频商业平台中的一项重要任务,在视频推荐与分类中有广泛应用。现有多数视频理解工作仅关注视频内容中出现的信息,包括视频帧、音频与文本。然而,当涉及与视频关联较弱的内容时,从外部知识图(KG)数据集引入常识知识对视频理解至关重要。由于缺乏视频知识图数据集,将视频理解与 KG 结合的工作很少。本文提出一个包含多模态视频实体与丰富常识关系的异质数据集。该数据集还提供了视频-关系-标签(VRT)与视频-关系-视频(VRV)等多类新颖视频推理任务。此外,基于该数据集,我们提出一个端到端模型,联合优化视频理解目标与知识图嵌入,其不仅能将事实知识更好地注入视频理解,还能为 KG 生成有效的多模态实体嵌入。综合实验表明,将视频理解嵌入与事实知识结合有益于基于内容的视频检索性能。而且,它还有助于模型生成更好的知识图嵌入,在 VRT 与 VRV 任务上以 HITS@10 至少 42.36% 与 17.73% 的提升优于传统基于 KGE 的方法。
引用
@article{arxiv.2211.10624,
title = {A Unified Model for Video Understanding and Knowledge Embedding with Heterogeneous Knowledge Graph Dataset},
author = {Jiaxin Deng and Dong Shen and Haojie Pan and Xiangyu Wu and Ximan Liu and Gaofeng Meng and Fan Yang and Size Li and Ruiji Fu and Zhongyuan Wang},
journal= {arXiv preprint arXiv:2211.10624},
year = {2023}
}
备注
Accepted by ICMR 2023