中文

一种用于足球视频摘要生成的多阶段深度架构

计算机视觉与模式识别 2022-05-04 v1 人工智能 机器学习 多媒体

摘要

视频内容正出现在越来越多科学与商业领域中。体育,尤其是足球,由于在赛事上的极高人气与新市场的涌现,是在视频分析领域投入最多的行业之一。先前最先进的足球比赛视频摘要方法依赖手工启发式规则生成摘要,泛化性差,但这些工作已证明多模态有助于检测比赛中的最佳动作。另一方面,具有更高泛化潜力的机器学习模型已进入通用视频摘要领域,提供了若干深度学习方法。然而,其中大多数利用的内容特性并不适用于体育整场视频。尽管视频内容多年来一直是足球知识自动化提取的主要来源,但记录场上所有事件的数据近来在体育分析中变得非常重要,因为该事件数据提供了更丰富的上下文信息且需要更少的处理。我们提出了一种利用音频与事件元数据生成足球比赛摘要的方法。结果表明,我们的方法能检测比赛动作,识别其中应属于摘要的动作,进而提出多个候选摘要,这些摘要在相似性足够的同时具有相关差异性,为最终编辑提供不同选项。此外,我们展示了工作的泛化能力,因其可在来自不同转播公司、不同赛事、不同条件下获取且对应不同长度摘要的数据集间迁移知识。

关键词

引用

@article{arxiv.2205.00694,
  title  = {A Multi-stage deep architecture for summary generation of soccer videos},
  author = {Melissa Sanabria and Frédéric Precioso and Pierre-Alexandre Mattei and Thomas Menguy},
  journal= {arXiv preprint arXiv:2205.00694},
  year   = {2022}
}