中文

基于相似性映射的神经模型重编程用于低资源语音命令识别

音频与语音处理 2023-10-31 v5 人工智能 机器学习 神经与进化计算 声音

摘要

在本研究中,我们提出一种新颖的对抗重编程(AR)方法用于低资源语音命令识别(SCR),并构建了 AR-SCR 系统。AR 过程旨在修改(来自目标域的)声学信号以重新利用(来自源域的)预训练 SCR 模型。为解决源域与目标域间的标签不匹配问题,并进一步提升 AR 的稳定性,我们提出一种新颖的基于相似性的标签映射技术来对齐类别。此外,将迁移学习(TL)技术与原始 AR 过程结合以提升模型自适应能力。我们在三个低资源 SCR 数据集(包括阿拉伯语、立陶宛语与构音障碍普通话语音)上评估所提出的 AR-SCR 系统。实验结果显示,利用在大规模英语数据集上预训练的 AM,所提 AR-SCR 系统在阿拉伯语与立陶宛语语音命令数据集上以仅限量的训练数据超越了当前最优结果。

关键词

引用

@article{arxiv.2110.03894,
  title  = {Neural Model Reprogramming with Similarity Based Mapping for Low-Resource Spoken Command Recognition},
  author = {Hao Yen and Pin-Jui Ku and Chao-Han Huck Yang and Hu Hu and Sabato Marco Siniscalchi and Pin-Yu Chen and Yu Tsao},
  journal= {arXiv preprint arXiv:2110.03894},
  year   = {2023}
}

备注

Accepted to Interspeech 2023. Code is available at: https://github.com/dodohow1011/SpeechAdvReprogram. Selected as Best Student Paper Candidate