中文

InverseMV:用卷积视频-音乐变换器创作钢琴曲谱

机器学习 2022-01-03 v1 计算机视觉与模式识别 多媒体 声音

摘要

许多社交媒体用户更喜欢以视频而非文本的形式消费内容。然而,为了让内容创作者制作出高点击率的视频,需要进行大量剪辑以使画面与音乐相匹配。这给更业余的视频制作者带来了额外的挑战。因此,我们提出了一种新颖的基于注意力的模型 VMT(Video-Music Transformer,视频-音乐变换器),可从视频帧自动生成钢琴曲谱。使用模型生成的音乐还可避免采用现有音乐时常带来的潜在版权侵权问题。据我们所知,除所提出的 VMT 外,尚无其他工作旨在为视频创作音乐。此外,目前缺乏具有对齐视频与符号音乐的数据集。我们发布了一个新数据集,包含超过 7 小时的钢琴曲谱,且流行音乐视频与 MIDI 文件之间精细对齐。我们以人工评估对 VMT、SeqSeq 模型(我们的基线)以及原版钢琴配乐进行了实验。VMT 在音乐流畅度与视频相关性上相较基线取得了一致提升。特别地,借助相关性分数与我们的案例研究,我们的模型展现出了利用帧级演员动作进行音乐生成的多模态能力。我们的 VMT 模型连同新数据集,为视频匹配配乐创作这一方向提供了有前景的研究路径。我们已在 https://github.com/linchintung/VMT 发布了代码。

关键词

引用

@article{arxiv.2112.15320,
  title  = {InverseMV: Composing Piano Scores with a Convolutional Video-Music Transformer},
  author = {Chin-Tung Lin and Mu Yang},
  journal= {arXiv preprint arXiv:2112.15320},
  year   = {2022}
}

备注

Rejected by ISMIR 2020