基于域对抗训练与互信息最小化的无监督域自适应构音障碍语音检测
音频与语音处理
2021-07-26 v1 计算与语言
声音
信号处理
摘要
构音障碍语音检测(Dysarthric Speech Detection, DSD)系统旨在从语音中检测神经运动障碍的特征。此类系统尤其易受域失配影响,即训练与测试数据分别来自源域和目标域,但两域可能在语音刺激、疾病病因等方面存在差异。由于在目标域中获取标注数据困难,标注大规模数据集成本高昂。本文首次尝试将跨域 DSD 表述为无监督域自适应(Unsupervised Domain Adaptation, UDA)问题。我们使用有标注的源域数据与无标注的目标域数据,并提出一种多任务学习策略,包括构音障碍存在分类(DPC)、域对抗训练(DAT)和互信息最小化(MIM),旨在学习具有构音障碍判别性与域不变性的生物标志物嵌入。具体而言,DPC 帮助生物标志物嵌入捕捉构音障碍的关键指标;DAT 迫使生物标志物嵌入在源域和目标域中不可区分;MIM 进一步降低生物标志物嵌入与域相关线索之间的相关性。以 UASPEECH 和 TORGO 语料库分别作为源域和目标域,实验表明引入 UDA 在话语级加权平均召回率和说话人级准确率上分别获得了 22.2% 和 20.0% 的绝对提升。
引用
@article{arxiv.2106.10127,
title = {Unsupervised Domain Adaptation for Dysarthric Speech Detection via Domain Adversarial Training and Mutual Information Minimization},
author = {Disong Wang and Liqun Deng and Yu Ting Yeung and Xiao Chen and Xunying Liu and Helen Meng},
journal= {arXiv preprint arXiv:2106.10127},
year = {2021}
}
备注
Accepted to Interspeech 2021