面向实时人机音乐共演:基于潜在扩散模型和MAX/MSP的伴奏生成
声音
2026-04-10 v1 人工智能
摘要
我们提出了一个用于实时人机音乐共演的框架,该框架利用潜在扩散模型生成对live stream上下文音频的伴奏。该系统将MAX/MSP前端用于实时音频输入、缓冲和播放,与运行生成模型的Python推理服务器通过OSC/UDP消息进行通信。这使得音乐家能够在MAX/MSP中进行表演,而与大规模Python生成模型互动,从而克服了实时音乐工具与最先进AI模型之间的根本性隔阂。我们将伴奏生成建模为滑动窗口前瞻协议,在训练时模型需从部分上下文预测未来音频,其中系统延迟是关键约束。为降低延迟,我们对扩散模型应用一致性蒸馏,实现了5.4倍的采样时间缩减,两个模型均实现了实时操作。评估指标包括音乐连贯性、节拍对齐和音频质量,两个模型在Retrospective regime中表现优异,随着前瞻深度增加,性能会优雅地下降。这些结果表明了基于扩散的实时伴奏的可行性,并揭示了模型延迟、前瞻深度与生成质量之间的根本性权衡——任何此类系统都必须权衡这些因素。
引用
@article{arxiv.2604.07612,
title = {Towards Real-Time Human-AI Musical Co-Performance: Accompaniment Generation with Latent Diffusion Models and MAX/MSP},
author = {Tornike Karchkhadze and Shlomo Dubnov},
journal= {arXiv preprint arXiv:2604.07612},
year = {2026}
}
备注
12 pages, 6 figures