SongDriver: 无逻辑延迟且无暴露偏差的实时音乐伴奏生成
声音
2022-10-14 v2 机器学习
多媒体
音频与语音处理
摘要
实时音乐伴奏生成在音乐产业中具有广泛应用,如音乐教育与现场演出。然而,自动实时音乐伴奏生成研究仍不充分,且常面临逻辑延迟与暴露偏差之间的权衡。本文提出SongDriver,一种无逻辑延迟且无暴露偏差的实时音乐伴奏生成系统。具体而言,SongDriver将一个伴奏生成任务划分为两个阶段:1)编曲阶段,Transformer模型首先为输入旋律实时编排和弦,并将和弦缓存至下一阶段而非立即播放;2)预测阶段,CRF模型基于先前缓存的和弦为即将到来的旋律生成可演奏的多轨伴奏。借助该两阶段策略,SongDriver直接为后续旋律生成伴奏,实现零逻辑延迟。此外,在预测某时间步和弦时,SongDriver参考第一阶段缓存的和弦而非自身先前预测,从而规避暴露偏差问题。由于实时条件下输入长度常受限,另一潜在问题是长程序列信息丢失。为弥补此缺陷,我们在当前时间步之前从长时音乐片段中提取四种音乐特征作为全局信息。实验中,我们在若干开源数据集及自建的源自中式现代流行乐谱的aiSong Dataset上训练SongDriver。结果表明,SongDriver在客观与主观指标上均优于现有SOTA(最先进)模型,同时显著降低了物理延迟。
引用
@article{arxiv.2209.06054,
title = {SongDriver: Real-time Music Accompaniment Generation without Logical Latency nor Exposure Bias},
author = {Zihao Wang and Qihao Liang and Kejun Zhang and Yuxing Wang and Chen Zhang and Pengfei Yu and Yongsheng Feng and Wenbo Liu and Yikai Wang and Yuntai Bao and Yiheng Yang},
journal= {arXiv preprint arXiv:2209.06054},
year = {2022}
}
备注
*Both Zihao Wang and Qihao Liang contribute equally to the paper and share the co-first authorship. This paper has been accepted by ACM Multimedia 2022, oral session, full paper (main track)