基于长短期记忆网络的无文本无关说话人确认
音频与语音处理
2018-09-10 v3 计算与语言
声音
摘要
本文提出了一种基于长短期记忆(Long Short-Term Memory, LSTM)网络的架构,用于文本无关场景,旨在通过对传统语音特征进行操作来捕获与说话人相关的时间信息。对于说话人确认,首先必须创建用于说话人表示的背景模型。随后在注册阶段,基于注册语音创建说话人模型。本工作中,模型将以端到端方式训练,以合并前两个阶段。端到端训练的主要目标是使模型优化得与说话人确认协议相一致。该端到端训练通过创建表示空间来联合学习背景模型与说话人模型。LSTM 架构被训练用于创建判别空间,以验证说话人确认中的匹配与非匹配对。所提架构在文本无关场景下相较于其他传统方法展现出了优越性。
引用
@article{arxiv.1805.00604,
title = {Text-Independent Speaker Verification Using Long Short-Term Memory Networks},
author = {Aryan Mobiny and Mohammad Najarian},
journal= {arXiv preprint arXiv:1805.00604},
year = {2018}
}