面向口吃语音、乐器、未见语言及文本描述声音的语音转换
音频与语音处理
2023-10-13 v1 计算与语言
声音
摘要
语音转换旨在利用目标说话人的录音作为参考,将源语音转换为目标声音。较新的模型正产生越来越真实的输出。但当模型被输入非标准数据(例如来自有言语障碍用户的语音)时会发生什么?我们研究了一个近期语音转换模型在非标准下游语音转换任务上的表现。我们使用一种简单但稳健的方法,称为 k 近邻语音转换(kNN-VC)。我们考察了四种非标准应用:口吃语音转换、跨语言语音转换、乐器转换和文本到语音转换。后者涉及转换到通过文本描述指定的目标声音,例如“一个高嗓音的年轻男子”。与既定基线相比,我们发现 kNN-VC 在口吃和跨语言语音转换中保持了高性能。对于乐器和文本到语音转换任务,结果则喜忧参半。例如,kNN-VC 在鼓等某些乐器上表现良好,但在其他乐器上不行。尽管如此,这表明语音转换模型——尤其是 kNN-VC——正日益适用于一系列非标准下游任务。但当样本远离训练分布时仍存在局限。代码、样本、训练模型:https://rf5.github.io/sacair2023-knnvc-demo/。
引用
@article{arxiv.2310.08104,
title = {Voice Conversion for Stuttered Speech, Instruments, Unseen Languages and Textually Described Voices},
author = {Matthew Baas and Herman Kamper},
journal= {arXiv preprint arXiv:2310.08104},
year = {2023}
}
备注
11 pages, 1 figure, 5 tables. Accepted at SACAIR 2023