中文

扩大自监督语音模型规模揭示深层语言关系:来自太平洋簇的证据

计算与语言 2026-03-10 v1 音频与语音处理

摘要

自监督语音模型(S3M)派生的语言表征相似性似乎主要反映地理接近性或由最近扩张或接触驱动的表层类型学相似性,可能遗漏更深层的族谱信号。我们研究了将 S3M 基于语言识别系统的语言覆盖范围从 126 扩展到 4017 种语言对这一拓扑结构的影响。我们的结果揭示了非线性效应:虽然在 1K 规模时族谱恢复保持不变,但 4K 模型显示出显著的质变,既能解析清晰族系,也能解析复杂且长期语言接触。值得注意的是,我们分析发现太平洋地区(包含澳大利亚、波利尼西亚和巴布亚语言)出现了一个稳健的宏簇,并研究其潜在驱动因素。我们发现 4K 模型利用更集中地编码,捕捉诸如全球能量动力学等共享、稳健的声学特征。这些发现表明,大规模 S3M 能够内化多层语言历史,为计算族谱学和语言接触研究提供了有前景的视角。

关键词

引用

@article{arxiv.2603.07238,
  title  = {Scaling Self-Supervised Speech Models Uncovers Deep Linguistic Relationships: Evidence from the Pacific Cluster},
  author = {Minu Kim and Hoirin Kim and David R. Mortensen},
  journal= {arXiv preprint arXiv:2603.07238},
  year   = {2026}
}

备注

Submitted to Interspeech 2026