中文

SSL 语音模型为何能捕捉音调?在低资源迁移条件下的音调表征的时间焦点

音频与语音处理 2026-01-27 v2 计算与语言

摘要

词汇音调是许多语言的核心要素,但在自监督学习(SSL)语音模型中仍有待探索,尤其是超出普通话之外。我们研究四种具有复杂且多样化音调系统的语言(克缅语、泰语、老挝语和越南语),以探究这些模型“倾听”音调的范围以及在低资源条件下的迁移机制。作为基准参考,我们估计音调线索的时间跨度:约100ms(克缅语/泰语)和180ms(老挝语/越南语)。对微调后 SSL 模型的探针和梯度分析揭示,音调迁移因下游任务而异:自动语音识别微调使时间跨度与语言特定音调线索一致,而其他任务则倾向于偏向过长的时间跨度。这些发现表明,音调迁移受下游任务影响,凸显了音调建模中任务对时间焦点的影响。

关键词

引用

@article{arxiv.2511.12285,
  title  = {How Far Do SSL Speech Models Listen for Tone? Temporal Focus of Tone Representation under Low-resource Transfer},
  author = {Minu Kim and Ji Sub Um and Hoirin Kim},
  journal= {arXiv preprint arXiv:2511.12285},
  year   = {2026}
}

备注

5 pages, 7 figures, accepted to ICASSP 2026