中文

利用基于 Transformer 的语音编码器模型识别相关语言与方言中的主重音

音频与语音处理 2025-06-02 v1 计算与语言 声音

摘要

由于重音在编码含义和辅助语音理解中的作用,主重音识别的自动化一直是一个活跃的研究领域。以往的研究主要依赖传统声学特征和英语数据集。在本文中,我们研究了对预训练 Transformer 模型进行微调并配备音频帧分类头的方法。我们的实验使用了一个新的克罗地亚语训练数据集,测试集涵盖克罗地亚语、塞尔维亚语、查方言和斯洛文尼亚语。通过将使用传统声学特征的 SVM 分类器与微调后的语音 Transformer 进行比较,我们证明了 Transformer 在各项测试中均表现出优越性,在克罗地亚语和塞尔维亚语上取得了近乎完美的结果,而在差异较大的查方言和斯洛文尼亚语上性能下降了 10 个百分点。最后,我们表明仅需数百个多音节训练词即可实现强劲的性能。我们在宽松许可下发布了我们的数据集和模型。

关键词

引用

@article{arxiv.2505.24571,
  title  = {Identifying Primary Stress Across Related Languages and Dialects with Transformer-based Speech Encoder Models},
  author = {Nikola Ljubešić and Ivan Porupski and Peter Rupnik},
  journal= {arXiv preprint arXiv:2505.24571},
  year   = {2025}
}

备注

Accepted to InterSpeech2025