中文

基于 Transformer 的深度足球视频字幕生成:数据集、语义相关损失与多层次评估

计算机视觉与模式识别 2022-12-01 v2 人工智能

摘要

本工作旨在利用深度学习为足球视频生成字幕。在此背景下,本文引入了一个数据集、模型以及三级评估。该数据集包含 22k 个字幕-片段对,以及约 500 小时 \emph{SoccerNet} 视频的三种视觉特征(图像、光流、修复)。模型分为三部分:一个 transformer 学习语言,卷积网络学习视觉,语言与视觉特征的融合生成字幕。本文建议从三个层面对生成字幕进行评估:句法(常用评估指标如 BLEU-score 和 CIDEr)、语义(领域专家对描述质量的评价)和语料(生成字幕的多样性)。本文表明,通过优先选定词的语义相关损失,生成字幕的多样性得以提升(从 0.07 达到 0.18)。语义相关损失及更多视觉特征(光流、修复)的利用将归一化字幕得分提高了 28%。本工作网页:https://sites.google.com/view/soccercaptioning

关键词

引用

@article{arxiv.2202.05728,
  title  = {Deep soccer captioning with transformer: dataset, semantics-related losses, and multi-level evaluation},
  author = {Ahmad Hammoudeh and Bastien Vanderplaetse and Stéphane Dupont},
  journal= {arXiv preprint arXiv:2202.05728},
  year   = {2022}
}