知识引导的实体感知视频描述与篮球基准
计算机视觉与模式识别
2024-02-29 v2
摘要
尽管近期出现了视频描述模型,但如何生成带有特定实体名称和细粒度动作的文本描述仍远未得到解决,然而这在篮球文字直播等应用中具有巨大价值。本文提出了一种新的由多模态知识图谱支持的篮球视频描述基准。具体而言,我们构建了一个多模态篮球比赛知识图谱(KG_NBA_2022),以提供视频之外的额外知识。然后,基于 KG_NBA_2022 构建了一个多模态篮球比赛视频描述(VC_NBA_2022)数据集,该数据集包含 9 种细粒度投篮事件和 286 名球员的知识(即图像和姓名)。我们基于编码器-解码器形式中的候选球员列表,开发了一种知识引导的实体感知视频描述网络(KEANet),用于篮球文字直播。通过引入双向 GRU(Bi-GRU)模块对视频中的时序上下文信息进行编码。并设计了实体感知模块,以建模球员之间的关系并突出关键球员。在多个体育基准上的大量实验表明,KEANet 有效利用了外部知识,并优于先进的视频描述模型。所提数据集及相应代码将很快公开发布。
引用
@article{arxiv.2401.13888,
title = {Knowledge Guided Entity-aware Video Captioning and A Basketball Benchmark},
author = {Zeyu Xi and Ge Shi and Xuefen Li and Junchi Yan and Zun Li and Lifang Wu and Zilin Liu and Liang Wang},
journal= {arXiv preprint arXiv:2401.13888},
year = {2024}
}