利用知识蒸馏的双模模型增强语言识别
音频与语音处理
2022-03-08 v1 计算与语言
声音
摘要
本文中,我们提出在 x-vector 自注意力(XSA-LID)模型上采用双模框架并结合知识蒸馏(KD),以增强其对长、短语音的语言识别(LID)性能。双模 XSA-LID 模型通过联合优化完整模式与短模式进行训练,其各自输入分别为完整长度语音和由特定布尔掩码提取的短片段,并应用 KD 进一步提升短语音上的性能。此外,我们通过分析被模仿语音片段的长度与位置变化所对应的 LID 性能变化,考察了片段级语言变异性与词汇完整性对 LID 的影响。我们在 NIST 2017 LRE 的 MLS14 数据上评估了该方法。使用 3 秒随机位置布尔掩码时,相较于 XSA-LID 模型,我们所提方法在 3 秒、10 秒和 30 秒语音上的平均代价分别取得了 19.23%、21.52% 和 8.37% 的相对提升。
引用
@article{arxiv.2203.03218,
title = {Enhance Language Identification using Dual-mode Model with Knowledge Distillation},
author = {Hexin Liu and Leibny Paola Garcia Perera and Andy W. H. Khong and Justin Dauwels and Suzy J. Styles and Sanjeev Khudanpur},
journal= {arXiv preprint arXiv:2203.03218},
year = {2022}
}
备注
Submitted to Odyssey 2022