基于 Transformer 的深度足球视频字幕生成:数据集、语义相关损失与多层次评估
计算机视觉与模式识别
2022-12-01 v2 人工智能
摘要
本工作旨在利用深度学习为足球视频生成字幕。在此背景下,本文引入了一个数据集、模型以及三级评估。该数据集包含 22k 个字幕-片段对,以及约 500 小时 \emph{SoccerNet} 视频的三种视觉特征(图像、光流、修复)。模型分为三部分:一个 transformer 学习语言,卷积网络学习视觉,语言与视觉特征的融合生成字幕。本文建议从三个层面对生成字幕进行评估:句法(常用评估指标如 BLEU-score 和 CIDEr)、语义(领域专家对描述质量的评价)和语料(生成字幕的多样性)。本文表明,通过优先选定词的语义相关损失,生成字幕的多样性得以提升(从 0.07 达到 0.18)。语义相关损失及更多视觉特征(光流、修复)的利用将归一化字幕得分提高了 28%。本工作网页:https://sites.google.com/view/soccercaptioning
引用
@article{arxiv.2202.05728,
title = {Deep soccer captioning with transformer: dataset, semantics-related losses, and multi-level evaluation},
author = {Ahmad Hammoudeh and Bastien Vanderplaetse and Stéphane Dupont},
journal= {arXiv preprint arXiv:2202.05728},
year = {2022}
}