中文

基于知识图谱增强文本Transformer的视频描述生成

计算机视觉与模式识别 2023-03-28 v2

摘要

视频描述生成旨在用自然语言描述视频内容。尽管已取得显著进展,由于长尾词挑战,面向真实世界应用性能仍有很大提升空间。本文提出一种基于知识图谱增强文本的Transformer(TextKG)用于视频描述生成。值得注意的是,TextKG 是一个由外部流和内部流组成的两流 Transformer。外部流旨在吸收额外知识,建模额外知识(如预建知识图谱)与视频内置信息(如显著目标区域、语音转录和视频描述)之间的交互,以缓解长尾词挑战。同时,内部流旨在利用视频中的多模态信息(如视频帧外观、语音转录和视频描述)以确保描述结果的质量。此外,两流之间还使用交叉注意力机制来共享信息。通过这种方式,两流可相互帮助以获得更准确的结果。在 YouCookII、ActivityNet Captions、MSRVTT 和 MSVD 四个具有挑战性的视频描述数据集上的大量实验表明,所提方法优于当前最优方法。具体而言,所提 TextKG 方法在 YouCookII 数据集上通过提升 18.7% 的绝对 CIDEr 分数超越了已发表的最佳结果。

关键词

引用

@article{arxiv.2303.12423,
  title  = {Text with Knowledge Graph Augmented Transformer for Video Captioning},
  author = {Xin Gu and Guang Chen and Yufei Wang and Libo Zhang and Tiejian Luo and Longyin Wen},
  journal= {arXiv preprint arXiv:2303.12423},
  year   = {2023}
}

备注

Accepted by CVPR2023