中文

ViolinDiff: 通过音高 Bend条件增强表达性小提琴合成

声音 2025-02-05 v2 人工智能 机器学习 音频与语音处理 信号处理

摘要

建模基本频率(F0)的自然轮廓在音频合成中至关重要。然而,在多音乐乐器合成中转录和管理多个F0轮廓具有挑战性,显式F0轮廓建模尚未用于多音乐乐器合成。本文提出ViolinDiff,一个两阶段扩散合成框架。对于给定的小提琴MIDI文件,第一阶段将F0轮廓估计为音高Bend信息,第二阶段生成包含这些表现性细节的母声谱图。定量指标和听觉测试结果表明,采用显式音高Bend建模的模型在生成更真实的小提琴声方面优于不采用此类建模的模型。音频样本在线提供:daewoung.github.io/ViolinDiff-Demo。

关键词

引用

@article{arxiv.2409.12477,
  title  = {ViolinDiff: Enhancing Expressive Violin Synthesis with Pitch Bend Conditioning},
  author = {Daewoong Kim and Hao-Wen Dong and Dasaem Jeong},
  journal= {arXiv preprint arXiv:2409.12477},
  year   = {2025}
}

备注

Accepted for publication at ICASSP 2025