长期节奏视频配乐生成器
声音
2023-05-31 v2 计算机视觉与模式识别
多媒体
音频与语音处理
摘要
我们考虑生成与节奏视觉线索同步的音乐配乐的问题。大多数现有工作依赖于预定义的音乐表示,导致生成灵活性与复杂度不足。其他直接生成视频条件波形的方法受限于场景少、长度短和生成质量不稳定。为此,我们提出长期节奏视频配乐生成器(LORIS),一种合成长期条件波形的新框架。具体而言,我们的框架由一个潜在条件扩散概率模型组成以执行波形合成。此外,提出了一系列上下文感知条件编码器,将时间信息纳入考虑以实现长期生成。值得注意的是,我们将模型的适用性从舞蹈扩展到体操和花样滑冰等多种体育场景。为进行全面评估,我们建立了节奏视频配乐的基准,包括预处理数据集、改进的评估指标和鲁棒的 generative baselines。大量实验表明,我们的模型生成的长期配乐具有最先进的音乐质量和节奏对应性。代码见 \url{https://github.com/OpenGVLab/LORIS}。
引用
@article{arxiv.2305.01319,
title = {Long-Term Rhythmic Video Soundtracker},
author = {Jiashuo Yu and Yaohui Wang and Xinyuan Chen and Xiao Sun and Yu Qiao},
journal= {arXiv preprint arXiv:2305.01319},
year = {2023}
}
备注
ICML2023