基于可变帧率的数据增强以应对说话风格变化性用于自动说话人确认
音频与语音处理
2020-08-11 v1 机器学习
信号处理
摘要
使用 UCLA 说话人变化性数据库研究了说话风格变化性对自动说话人确认的影响,该库包含每位说话人的多种说话风格。一个 x-vector/PLDA(概率线性判别分析)系统使用 SRE 与 Switchboard 数据库及标准增强技术训练,并用 UCLA 数据库中的语句进行评估。当注册与测试语句风格相同时,等错误率(EER)较低(例如朗读与对话语音分别为 0.98% 与 0.57%),但当注册与测试语句风格不匹配时,EER 大幅上升。例如,以对话语句注册时,在朗读、叙述及宠物导向语音上测试 EER 分别升至 3.03%、2.96% 与 22.12%。为降低风格失配影响,我们提出一种基于熵的可变帧率技术,以人工生成风格归一化表示用于 PLDA 自适应。所提系统显著改善性能。在上述条件下,EER 改善为 2.69%(对话–朗读)、2.27%(对话–叙述)与 18.75%(宠物导向–朗读)。总体而言,所提技术性能与多风格 PLDA 自适应相当,且无需每位说话人不同说话风格的训练数据。
引用
@article{arxiv.2008.03616,
title = {Variable frame rate-based data augmentation to handle speaking-style variability for automatic speaker verification},
author = {Amber Afshan and Jinxi Guo and Soo Jin Park and Vijay Ravi and Alan McCree and Abeer Alwan},
journal= {arXiv preprint arXiv:2008.03616},
year = {2020}
}
备注
Accepted to Interspeech 2020