从语音中学习域不变表示用于儿童-成人分类
音频与语音处理
2019-10-28 v1 机器学习
声音
摘要
ASD(自闭症谱系障碍)的诊断流程涉及儿童与临床医生间的半自然互动。分析这些会话的计算方法需要一条端到端的语音与语言处理流水线,从原始音频到具有临床意义的行为特征。该流水线的一个重要组件是自动检测何时由谁说话,即执行儿童-成人说话人分类。这一二分类任务常因参与者语音与背景条件相关变异而受干扰。此外,训练数据的稀缺常限制常规深度学习方法直接应用。本工作中,我们利用域对抗学习(无需标注目标域数据)处理了两种主要变异来源——儿童年龄与数据采集地点。我们使用两种方法,即带反转标签损失的生成对抗训练与梯度反转层,来学习对上述变异来源不变的说话人嵌入,并分析了所提技术优于常规学习方法的不同条件。利用 ADOS-2(自闭症诊断观察量表,第 2 版)会话的大型语料库,我们展示了相较常规学习方法最高 13.45% 与 6.44% 的相对提升。
引用
@article{arxiv.1910.11472,
title = {Learning Domain Invariant Representations for Child-Adult Classification from Speech},
author = {Rimita Lahiri and Manoj Kumar and Somer Bishop and Shrikanth Narayanan},
journal= {arXiv preprint arXiv:1910.11472},
year = {2019}
}
备注
Submitted to ICASSP 2020