基于人声模仿与声音事件标签的环境音合成
声音
2023-09-15 v2 音频与语音处理
摘要
表达环境音的一种方式是使用人声模仿,其涉及通过嗓音复现或模仿声音节奏与音高的过程。在环境音合成模型中,我们可以利用人声模仿有效表达环境音的节奏、音高等特征,而这些特征是传统的输入信息(如声音事件标签、图像或文本)所无法表达的。本文提出一种基于向量量化编码器与 Tacotron2 解码器框架的、从人声模仿与声音事件标签进行环境音合成的框架。使用人声模仿有望控制合成声音的 pitch 与节奏,而仅用声音事件标签无法控制这些。我们的客观与主观实验结果表明,人声模仿能有效控制合成声音的 pitch 与节奏。
引用
@article{arxiv.2305.00302,
title = {Environmental sound synthesis from vocal imitations and sound event labels},
author = {Yuki Okamoto and Keisuke Imoto and Shinnosuke Takamichi and Ryotaro Nagase and Takahiro Fukumori and Yoichi Yamashita},
journal= {arXiv preprint arXiv:2305.00302},
year = {2023}
}
备注
Submitted to ICASSP2024