自监督语音模型中的词音节:跨语言比较
计算与语言
2025-07-08 v1 人工智能
摘要
本文研究了自监督语音模型(Self-Supervised Speech Models, S3M),具体指Wav2vec 2.0模型所学习的词音节表示。我们考察了S3M对五种语言的词音节表示:三种具有变长或词典音节的语言(荷兰语、英语和德语),以及两种具有固定或显著音节的语言(匈牙利语和波兰语)。我们在S3M嵌入上训练诊断性词音节分类器,并展示它们能够以高准确率区分读 aloud 短句子中重读音节和非重读音节。我们还测试了S3M词音节的语言特定性效应。结果表明,词音节表示是语言特定的,对于变长与固定音节语言的差异更为显著。
引用
@article{arxiv.2507.04738,
title = {Word stress in self-supervised speech models: A cross-linguistic comparison},
author = {Martijn Bentum and Louis ten Bosch and Tomas O. Lentz},
journal= {arXiv preprint arXiv:2507.04738},
year = {2025}
}
备注
Accepted to Interspeech 2025