邻居与亲属:语音嵌入如何反映全球语言间的 linguistic 连接
计算与语言
2025-06-11 v1 声音
音频与语音处理
摘要
在全球范围内探索语言关系需要分析多样化的特征,如语法、音韵和韵律,这些特征的演化速率受到内部多样化、语言接触和社会语言因素的影响。近期的机器学习(ML)进展为传统的历史和类型学方法提供了互补替代方案。与依赖分析特定语言特征的专家工作相比,这些新方法使我们能够通过直接从语音中派生的嵌入来探索语言变异,为大规模、数据驱动的分析开辟了新途径。本研究采用经 fine-tuning 的 XLS-R 自监督语言识别模型 voxlingua107-xls-r-300m-wav2vec 的嵌入,分析基于语音录音的 106 种世界语言之间的关系。使用线性判别分析(LDA),对语言嵌入进行聚类,并与族系、词汇和地理距离进行比较。结果表明,嵌入距离与传统度量方式高度一致,有效捕捉全局和局部类型模式。关于使用层次聚类和网络方法进行关系可视化的挑战,凸显了语言变化的动态本质。研究结果表明,基于语音嵌入的可扩展语言变异分析具有潜力,为语言间关系提供了新视角。通过解决诸如语料库规模和潜在空间维数等方法论问题,这种方法为研究低资源语言并连接宏观与微观语言变异开辟了途径。未来工作旨在将这些方法扩展到支持不足的语言并整合社会语言变异,以更全面的方式理解语言多样性。
引用
@article{arxiv.2506.08564,
title = {Neighbors and relatives: How do speech embeddings reflect linguistic connections across the world?},
author = {Tuukka Törö and Antti Suni and Juraj Šimko},
journal= {arXiv preprint arXiv:2506.08564},
year = {2025}
}
备注
27 pages, 11 figures (+5 supplementary), submitted to PLOS One