中文

Audeo:面向无声演奏视频的音频生成

计算机视觉与模式识别 2020-11-10 v1 机器学习 多媒体 声音 音频与语音处理 图像与视频处理

摘要

我们提出了一种新颖的系统,其输入为音乐家弹奏钢琴的视频帧,并生成该视频对应的音乐。从视觉线索生成音乐是一个具有挑战性的问题,且尚不清楚这是否是一个可实现的目标。本工作的主要目的在于探索这种转换的可行性,并识别能够承载声音与视觉事件关联的线索与组件。为实现该转换,我们构建了一个名为“Audeo”的完整流水线,包含三个组件。我们首先将键盘与音乐家手部运动的视频帧转换为每帧的原始机械音乐符号表示 Piano-Roll(Roll),其表示每个时间步按下的琴键。然后,我们通过引入时间相关性来调整 Roll 以适于音频合成。该步骤被证明对于有意义的音频生成至关重要。最后,我们实现 Midi 合成器以生成逼真的音乐。Audeo 仅需少量设置约束即可平滑且清晰地实现视频到音频的转换。我们在“真实场景”钢琴演奏视频上评估 Audeo,所得生成音乐具有合理的音频质量,且能被流行的音乐识别软件以高精度成功识别。

关键词

引用

@article{arxiv.2006.14348,
  title  = {Audeo: Audio Generation for a Silent Performance Video},
  author = {Kun Su and Xiulong Liu and Eli Shlizerman},
  journal= {arXiv preprint arXiv:2006.14348},
  year   = {2020}
}

备注

Please see associated video at https://www.youtube.com/watch?v=8rS3VgjG7_c