中文

The Concatenator:实时拼接音频合成的贝叶斯方法

声音 2024-11-08 v1 信息检索 多媒体 音频与语音处理

摘要

我们提出了 ``The Concatenator'',一个用于音频引导拼接合成的实时系统。类似于 Driedger 等人的 ``musaicing''(或 ``音频拼接'')技术,我们在音频语料库中拼接一定数量的窗口,以重新创建目标音频流的谐波和打击乐方面。然而,与 Driedger 的基于 NMF 的技术不同,我们采用明确的贝叶斯观点,其中语料库窗口索引为隐状态,目标音频流为观测。我们使用粒子滤波来实时推断最佳隐语料库状态。我们的转移模型包含一个可调参数来控制语料库颗粒的时间连续性,我们的观测模型允许用户优先选择窗口变化以匹配目标的速度。由于系统的计算复杂度与语料库大小无关,我们的系统可以扩展到长达数小时的语料库,这在海量音频数据集合的时代是一个重要特性。在 The Concatenator 模块本身中,作曲家可以实时变化颗粒长度、拟合目标和音高偏移,同时对其听到的声音做出反应,使他们能够快速迭代创意。为了总结我们的工作,我们通过广泛的参数效应定量测试以及带有艺术见解的定性评估来评估我们的系统。基于结果的质量,我们相信实时能力为音乐表达和控制开辟了新途径,适用于现场表演和模块化合成集成,这进一步代表了拼接合成技术的一项重要突破。

关键词

引用

@article{arxiv.2411.04366,
  title  = {The Concatenator: A Bayesian Approach To Real Time Concatenative Musaicing},
  author = {Christopher Tralie and Ben Cantil},
  journal= {arXiv preprint arXiv:2411.04366},
  year   = {2024}
}

备注

12 pages, 6 figures, Accepted for Publication in The International Society for Music Information Retrieval Proceedings, 2024