基于语音转换的说话人归一化用于声学单元发现
音频与语音处理
2021-05-06 v1 计算与语言
声音
摘要
仅从语音输入中发现说话人无关的声学单元已知是一个困难问题。本工作中我们提出一种在单元发现之前的无监督说话人归一化技术。它基于用对抗对比预测编码方法分离语音信号中与说话人相关和内容引起的变化。该技术既不需要转写语音也不需要说话人标签,并且可以以多语言方式训练,从而即使在目标语言仅有少量无标签数据时也能实现说话人归一化。说话人归一化通过将全部话语映射到一个代表整个数据库的质心风格来完成。我们通过用隐马尔可夫模型变分自编码器进行声学单元发现展示了该方法的有效性,但需注意所提说话人归一化可作为任何单元发现系统的前端。在英语、约鲁巴语和 Mboshi 上的实验显示相较使用非归一化输入有所改进。
引用
@article{arxiv.2105.01786,
title = {Voice Conversion Based Speaker Normalization for Acoustic Unit Discovery},
author = {Thomas Glarner and Janek Ebbers and Reinhold Häb-Umbach},
journal= {arXiv preprint arXiv:2105.01786},
year = {2021}
}
备注
Submitted to Interspeech 2021