SportsSloMo:面向以人为中心视频帧插值的新基准与基线
计算机视觉与模式识别
2023-12-13 v2
摘要
以人为中心的视频帧插值在提升人们娱乐体验及在体育分析行业寻找商业应用(例如合成慢动作视频)方面具有巨大潜力。尽管社区中已有多个基准数据集,但无一专门面向以人为中心的场景。为弥补这一缺口,我们引入 SportsSloMo,一个由从 YouTube 爬取的超过 13 万段视频片段和 100 万帧高分辨率(≥720p)慢动作体育视频组成的基准。我们在该基准上重新训练了几种 SOTA 方法,结果显示其精度相较于其他数据集有所下降。这凸显了我们基准的难度,并表明即便对性能最佳的方法,它也构成了显著挑战,因为人体具有高度可变形性且体育视频中遮挡频繁。为提升精度,我们引入两个考虑人感知先验的损失项,分别对全景分割与人关键点检测添加辅助监督。这些损失项与模型无关,可轻松插入任何视频帧插值方法中。实验结果验证了我们所提损失项的有效性,在 5 个现有模型上带来一致的性能提升,从而在我们的基准上建立了强基线模型。数据集与代码见:https://neu-vi.github.io/SportsSlomo/。
引用
@article{arxiv.2308.16876,
title = {SportsSloMo: A New Benchmark and Baselines for Human-centric Video Frame Interpolation},
author = {Jiaben Chen and Huaizu Jiang},
journal= {arXiv preprint arXiv:2308.16876},
year = {2023}
}
备注
Project Page: https://neu-vi.github.io/SportsSlomo/