真实说话者是谁
声音
2024-05-02 v1 人工智能
多媒体
音频与语音处理
摘要
基于深度学习技术的语音转换(VC)现在可以生成高质量的 one-to-many 语音,因此已被用于一些实际应用领域,如娱乐和医疗保健。然而,当操纵语音被用于欺骗目的时,语音转换可能引发潜在的社会问题。此外,从转换后的语音中识别真实说话者是一个很大的挑战,因为源说话者的声学特征会发生很大变化。本文旨在探索从转换后的语音中识别真实说话者的可行性。本研究的假设是即使语音经过转换为不同的目标语音,来自源说话者的某些信息仍然存在。因此,我们的实验旨在识别给定转换后语音中的源说话者,这些语音是使用在随机配对的源和目标说话者上使用 FragmentVC 生成的。为提高对抗转换语音的鲁棒性,我们的识别模型采用深层神经网络中的层次化向量局部聚合描述符(VLAD)。该认证说话者识别系统主要在两个方面进行测试,包括转换语音质量的影响以及 VLAD 的变化。本工作使用的数据集是 VCTK 语料库,其中源和目标说话者被随机配对。对转换语音的实验结果显示,在识别来自转换后语音的真实说话者方面表现前景广阔。
关键词
引用
@article{arxiv.2405.00248,
title = {Who is Authentic Speaker},
author = {Qiang Huang},
journal= {arXiv preprint arXiv:2405.00248},
year = {2024}
}