GOAL:面向实时足球解说生成的基于知识的视频字幕挑战性基准
计算机视觉与模式识别
2023-10-06 v2 计算与语言
机器学习
摘要
尽管近期出现了视频字幕模型,如何基于背景知识(即关于特定领域场景的冗长且信息丰富、带有恰当推理的解说)生成生动、细粒度的视频描述仍远未解决,但其在自动体育叙事等方面具有重大应用价值。本文提出 GOAL,一个包含超过 8.9k 个足球视频片段、22k 个句子和 42k 个知识三元组的基准,用于提出一项具有挑战性的新任务设定:基于知识的视频字幕(KGVC)。此外,我们对现有方法进行了实验性适配,以展示解决这一有价值且可应用任务的难度与潜在方向。我们的数据与代码发布于 https://github.com/THU-KEG/goal。
引用
@article{arxiv.2303.14655,
title = {GOAL: A Challenging Knowledge-grounded Video Captioning Benchmark for Real-time Soccer Commentary Generation},
author = {Ji Qi and Jifan Yu and Teng Tu and Kunyu Gao and Yifan Xu and Xinyu Guan and Xiaozhi Wang and Yuxiao Dong and Bin Xu and Lei Hou and Juanzi Li and Jie Tang and Weidong Guo and Hui Liu and Yu Xu},
journal= {arXiv preprint arXiv:2303.14655},
year = {2023}
}
备注
Accepted by CIKM 2023