用于 ADReSS 2020 挑战赛的 INESC-ID 多模态系统
音频与语音处理
2020-06-01 v1
摘要
本文描述了在 INESC-ID 人类语言技术实验室参与 ADReSS 2020 挑战赛的背景下,提出的一种用于自动检测阿尔茨海默病的多模态方法。我们的分类框架利用了声学和文本特征嵌入,这些嵌入是独立提取的,随后进行组合。语音信号使用从预训练模型中提取的 DNN 说话人嵌入编码为声学特征。对于文本输入,首先使用英语 Bert 模型提取上下文嵌入向量,然后将其用于直接计算句子嵌入或馈入带有注意力机制的双向 LSTM-RNN。最后,使用具有线性核的 SVM 分类器对三个系统进行单独评估。我们基于语言和声学信息组合的最佳系统达到了 81.25% 的分类准确率。结果显示了语言特征在阿尔茨海默病分类中的重要性,其在准确率方面优于声学特征。早期阶段特征融合并未提供额外的改进,这证实了在这种情况下语音所传达的判别能力被语言数据所平滑。
引用
@article{arxiv.2005.14646,
title = {The INESC-ID Multi-Modal System for the ADReSS 2020 Challenge},
author = {Anna Pompili and Thomas Rolland and Alberto Abad},
journal= {arXiv preprint arXiv:2005.14646},
year = {2020}
}
备注
5 pages, 1 figure. Submitted to INTERSPEECH2020