中文

超越词汇内容的韵律结构:自监督学习研究

计算与语言 2025-06-04 v1 人工智能 音频与语音处理

摘要

人们在文本理解过程中会利用词汇结构的可预测性。尽管语音中也存在可预测的结构,但韵律(例如语调、语速和响度)在多大程度上独立于词汇内容对这种结构产生影响尚不清楚。本研究利用自监督学习 (SSL) 来检验韵律声学相关物中结构的时间粒度。我们提出的掩蔽韵律模型 的表征能够预测依赖于局部信息的感知标签(如词边界),但对于涉及长期结构的标签(如情感识别)则提供了最大的价值。在各种感知标签上的探测实验表明,相较于未变换的基频、能量和语音活动特征,取得了显著的相对增益。我们的结果揭示了 SSL 训练目标时间尺度的重要性,并突显了相较于受限的经典结构,复杂的 SSL 编码结构所具有的价值。

关键词

引用

@article{arxiv.2506.02584,
  title  = {Prosodic Structure Beyond Lexical Content: A Study of Self-Supervised Learning},
  author = {Sarenne Wallbridge and Christoph Minixhofer and Catherine Lai and Peter Bell},
  journal= {arXiv preprint arXiv:2506.02584},
  year   = {2025}
}

备注

Accepted at INTERSPEECH 2025