异构数据对基于语音的阿尔茨海默病检测的影响
机器学习
2018-11-30 v1 计算与语言
声音
音频与语音处理
机器学习
摘要
用于识别阿尔茨海默病(AD)的语音数据集通常限于受试者执行单一任务,例如描述展示给他们的图像。因此,基于此类数据集提取的语言特征训练的模型可能无法跨任务泛化。在先期工作表明健康受试者的同任务数据有助于改善单任务病理语音数据集上的 AD 检测之后,我们用多任务健康数据扩充了一个由受试者描述图片构成的 AD 专用数据集。我们证明,来自多个基于语音任务的规范数据可将 AD 检测提升多达 9%。决策边界的可视化显示,在结构化图片描述与非结构化会话语音组合上训练的模型具有最小的任务外误差,并展现出跨多任务泛化的最大潜力。我们分析了所添加样本的年龄及其是否影响分类公平性。我们还利用与模型无关的特征锚点,对跨任务可能的归纳偏置效应给出解释。本工作凸显了构建异构数据集以编码认知多方面变化、以及开发任务无关 AD 检测模型的必要性。
引用
@article{arxiv.1811.12254,
title = {The Effect of Heterogeneous Data for Alzheimer's Disease Detection from Speech},
author = {Aparna Balagopalan and Jekaterina Novikova and Frank Rudzicz and Marzyeh Ghassemi},
journal= {arXiv preprint arXiv:1811.12254},
year = {2018}
}
备注
Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216