面向创意应用的独立音轨间关系学习
声音
2025-10-01 v1 人工智能
人机交互
机器学习
音频与语音处理
摘要
本文介绍了音乐智能体领域内一个研究项目的第一步。其目标是通过训练,利用分离音轨数据库的整理,调谐现场音乐输入与实时生成音乐输出之间所需的音乐关系。我们提出了一种架构,集成了一个能够从此类音乐语料库中学习并利用音乐关系的符号决策模块。我们详细介绍了该架构的离线实现,采用 Transformers 作为决策模块,结合基于 Wav2Vec 2.0 的感知模块,并以拼接合成作为音频渲染器。我们对决策模块复现训练期间提取的已学习关系的能力进行了定量评估。我们证明,基于成对音轨(A, B)语料库,当由对应的“引导”音轨 A 调节时,我们的决策模块能够预测出连贯的音轨 B。
引用
@article{arxiv.2509.25296,
title = {Learning Relationships Between Separate Audio Tracks for Creative Applications},
author = {Balthazar Bujard and Jérôme Nika and Fédéric Bevilacqua and Nicolas Obin},
journal= {arXiv preprint arXiv:2509.25296},
year = {2025}
}