基于带样本亲和度检验的样本重加权的构音障碍语音去偏自动语音识别
音频与语音处理
2023-06-28 v3 计算与语言
机器学习
声音
摘要
基于深度学习的自动语音识别系统主要在经验风险最小化(ERM)下训练。由于 ERM 利用数据样本上的平均性能而不论健康或构音障碍说话人等群体,ASR 系统 unaware(未意识到)群体间的性能差异。这导致有偏的 ASR 系统,其群体间性能差异严重。在本研究中,我们旨在从群体鲁棒性方面改进针对构音障碍说话人的 ASR 系统。为实现目标,我们提出一种新方法,带样本亲和度检验的样本重加权(Re-SAT)。Re-SAT 系统性地度量给定数据样本的去偏帮助度,然后基于去偏帮助度进行样本重加权以减轻偏差。实验结果表明,Re-SAT 在构音障碍语音上提升了 ASR 性能,且在健康语音上无性能退化。
引用
@article{arxiv.2305.13108,
title = {Debiased Automatic Speech Recognition for Dysarthric Speech via Sample Reweighting with Sample Affinity Test},
author = {Eungbeom Kim and Yunkee Chae and Jaeheon Sim and Kyogu Lee},
journal= {arXiv preprint arXiv:2305.13108},
year = {2023}
}
备注
Accepted by Interspeech 2023