在口语识别神经模型涌现的表示中重新发现斯拉夫连续体
计算与语言
2020-10-26 v1
摘要
深度神经网络已被用于多种口语识别任务,包括本质上多语的口语语言识别任务。本文中,我们提出一种用于语音信号中斯拉夫语言识别的神经模型,并分析其涌现表示,以探究它们是否反映语言亲缘关系的客观度量及/或非语言学家对语言相似性的感知。尽管我们的分析表明语言表示空间确实在很大程度上捕捉了语言亲缘关系,但我们发现研究中语言间的感知混淆性是语言表示相似性的最佳预测因子。
引用
@article{arxiv.2010.11973,
title = {Rediscovering the Slavic Continuum in Representations Emerging from Neural Models of Spoken Language Identification},
author = {Badr M. Abdullah and Jacek Kudera and Tania Avgustinova and Bernd Möbius and Dietrich Klakow},
journal= {arXiv preprint arXiv:2010.11973},
year = {2020}
}
备注
Accepted in VarDial 2020 Workshop