中文

AutoMatch:面向助力深度学习视频编辑的大规模音频节拍匹配基准

声音 2023-03-06 v1 计算机视觉与模式识别 多媒体 音频与语音处理

摘要

短视频的爆发极大地重塑了人们的社交方式,催生了日常分享与获取最新信息的崭新趋势。这些丰富的视频资源一方面得益于带摄像头便携设备的普及,另一方面也离不开众多视频创作者宝贵剪辑工作的贡献。本文研究一个新颖且实用的问题,即音频节拍匹配(ABM),旨在基于背景音乐推荐合适的转场时间戳。该技术有助于缓解视频编辑中劳动密集型工作,节省创作者精力以更专注于视频内容创意。我们正式定义了ABM问题及其评估协议。同时,提出了一个大规模音频数据集,即含超过87k条精细标注背景音乐的AutoMatch,以推动这一新开启的研究方向。为进一步奠定后续研究的坚实基础,我们还提出了一种称为BeatX的新模型来解决这一挑战性任务。此外,我们创造性地提出标签范围概念,一次性消除了数据不平衡问题,并在训练过程中为真实标签分配自适应权重。尽管各类短视频平台已繁荣许久,相关场景研究仍不充分,据我们所知,AutoMatch是首个解决音频节拍匹配问题的大规模数据集。我们希望发布的数据集与具有竞争力的基线能引起更多对该研究线的关注。数据集与代码将公开可用。

关键词

引用

@article{arxiv.2303.01884,
  title  = {AutoMatch: A Large-scale Audio Beat Matching Benchmark for Boosting Deep Learning Assistant Video Editing},
  author = {Sen Pei and Jingya Yu and Qi Chen and Wozhou He},
  journal= {arXiv preprint arXiv:2303.01884},
  year   = {2023}
}

备注

11 pages, 5 figures