基于对抗学习探究语音停顿在痴呆检测中的可解释性
计算与语言
2021-11-16 v1 声音
音频与语音处理
摘要
语音停顿是痴呆检测中的有效生物标志物。近期的深度学习模型已利用语音停顿实现了高精度的痴呆检测,但尚未发掘语音停顿的可解释性,即哪些位置与长度的语音停顿如何影响痴呆检测结果、如何影响。本文将利用对抗学习方法研究对痴呆敏感的停顿的位置与长度。具体而言,我们首先采用对抗攻击方法,对测试样本的语音停顿添加扰动,旨在降低检测模型的置信度水平;随后应用对抗训练方法评估训练样本中扰动对检测模型的影响。我们从模型准确率、停顿上下文与停顿长度的角度考察可解释性。我们发现,从模型视角看部分停顿比其他停顿对痴呆更敏感,例如靠近动词“is”的语音停顿。增加敏感停顿的长度或添加敏感停顿会使模型推断趋向阿尔茨海默病(Alzheimer's Disease),而缩短敏感停顿长度或删除敏感停顿则趋向非AD。
引用
@article{arxiv.2111.07454,
title = {Towards Interpretability of Speech Pause in Dementia Detection using Adversarial Learning},
author = {Youxiang Zhu and Bang Tran and Xiaohui Liang and John A. Batsis and Robert M. Roth},
journal= {arXiv preprint arXiv:2111.07454},
year = {2021}
}