中文

Skating-Mixer:基于 MLP 的花样滑冰长时序音视频建模

计算机视觉与模式识别 2022-12-20 v4

摘要

花样滑冰评分具有挑战性,因为它需要评判运动员的技术动作以及其与背景音乐的协调性。大多数基于学习的方法不能很好地解决该问题,原因有二:1)花样滑冰中每个动作变化迅速,因此简单地采用传统帧采样会丢失大量有价值的信息,尤其在 3 到 5 分钟的长视频中;2)先前的方法很少在模型中考虑关键的音视频关系。出于这些原因,我们提出一种名为 Skating-Mixer 的新架构。它将 MLP 框架扩展为多模态形式,并通过我们设计的记忆循环单元(MRU)有效学习长时序表示。除模型外,我们收集了高质量的音视频 FS1000 数据集,包含超过 1000 个视频,涵盖 8 类节目和 7 种不同的评分指标,在数量和多样性上均超越其他数据集。实验表明,所提方法在公开 Fis-V 和我们的 FS1000 数据集上于所有主要指标取得 SOTA。此外,我们将方法应用于近期北京 2022 冬奥会比赛的分析,证明我们的方法具有很强的适用性。

关键词

引用

@article{arxiv.2203.03990,
  title  = {Skating-Mixer: Long-Term Sport Audio-Visual Modeling with MLPs},
  author = {Jingfei Xia and Mingchen Zhuge and Tiantian Geng and Shun Fan and Yuantai Wei and Zhenyu He and Feng Zheng},
  journal= {arXiv preprint arXiv:2203.03990},
  year   = {2022}
}

备注

Our code is available at https://github.com/AndyFrancesco29/Audio-Visual-Figure-Skating