中文

自监督语音表征中韵律与词汇线索在话轮转换中的作用

计算与语言 2026-01-21 v1

摘要

流畅的话轮转换仍然是人机交互中的一个关键挑战。自监督语音表征(S3Rs)推动了许多进展,但基于S3R的话轮转换模型是依赖韵律线索、词汇线索还是两者兼有,目前尚不清楚。我们引入了一种基于声码器的方法,能比先前工作更清晰地控制语音中的韵律和词汇线索。这使我们能够探测基于S3R的话轮转换模型——语音活动投影模型。我们发现,在韵律匹配但无法理解的噪声上的预测准确率与在干净语音上的准确率相似。这揭示了韵律和词汇线索都支持话轮转换,但两者均可被单独使用。因此,未来的模型可能只需要韵律信息,这提供了隐私保护和潜在的性能优势。当韵律或词汇信息之一被破坏时,模型无需额外训练即可利用另一种信息,表明它们在S3Rs中的编码具有有限的相互依赖性。在基于CPC和wav2vec2.0的S3Rs中,结果是一致的。我们讨论了这些发现,并指出了未来工作的若干方向。所有代码均已公开,以支持未来的研究。

关键词

引用

@article{arxiv.2601.13835,
  title  = {The Role of Prosodic and Lexical Cues in Turn-Taking with Self-Supervised Speech Representations},
  author = {Sam OConnor Russell and Delphine Charuau and Naomi Harte},
  journal= {arXiv preprint arXiv:2601.13835},
  year   = {2026}
}

备注

Accepted to ICASSP 2026