基于FHVAE与对抗训练的构音障碍不变弱监督特征用于口语理解
音频与语音处理
2022-10-25 v1 声音
摘要
构音障碍语音中训练数据的稀缺性和较大的说话人差异,导致构音障碍语音的口语理解系统准确率低且说话人泛化能力差。通过语音特征方面的工作,我们致力于在有限构音障碍数据下提升模型的泛化能力。无监督训练的因数化分层变分自编码器(FHVAE)已在解耦内容与说话人表征方面展现出优势。先前研究表明构音障碍同时体现在两类特征向量中。在此,我们加入对抗训练以弥合对照组与构音障碍语音数据域之间的差距。我们利用弱监督提取构音障碍与说话人不变特征。所提取的特征在口语理解任务上进行了评估,与基础FHVAE模型或普通滤波器组的特征相比,在具有更严重构音障碍的未见说话人上取得了更高的准确率。
引用
@article{arxiv.2210.13144,
title = {Weak-Supervised Dysarthria-invariant Features for Spoken Language Understanding using an FHVAE and Adversarial Training},
author = {Jinzi Qi and Hugo Van hamme},
journal= {arXiv preprint arXiv:2210.13144},
year = {2022}
}