LSTM与GPT-2合成语音迁移学习用于说话人识别以克服数据稀缺
音频与语音处理
2020-07-06 v2 机器学习
声音
摘要
在语音识别问题中,由于人类不愿提供大量数据用于学习与分类,数据稀缺常常构成一个问题。本工作中,我们取出来自7名受试者的5句哈佛句子语音,并考察其MFCC属性。利用字符级LSTM(监督学习)与OpenAI基于注意力的GPT-2模型,通过按受试者逐人学习所提供的数据,生成合成的MFCC。训练一个神经网络将此类数据对大规模Flickr8k说话人数据集进行分类,随后与一个执行相同任务但初始权重分布由两种模型生成的合成数据学习所决定的迁移学习网络进行比较。7名受试者的最佳结果均来自接触过合成数据的网络:由LSTM生成数据预训练的模型取得3次最佳,GPT-2对应模型取得5次最佳(因一名受试者两种模型并列最佳)。基于这些结果,我们认为说话人分类可通过利用少量用户数据并结合接触合成生成的MFCC得以改进,从而使网络达到近乎最大的分类分数。
引用
@article{arxiv.2007.00659,
title = {LSTM and GPT-2 Synthetic Speech Transfer Learning for Speaker Recognition to Overcome Data Scarcity},
author = {Jordan J. Bird and Diego R. Faria and Anikó Ekárt and Cristiano Premebida and Pedro P. S. Ayrosa},
journal= {arXiv preprint arXiv:2007.00659},
year = {2020}
}
备注
10 pages, 5 figures, 5 tables. Submitted to journal