自监督语音模型对荷兰语了解多少?分析语言特定预训练的优势
计算与语言
2025-07-11 v2 人工智能
声音
音频与语音处理
摘要
自监督模型学习到的语音表示具有多大程度的语言特定性?现有工作表明,仅基于语音录音训练的端到端模型可以成功解码出一系列语言特征。然而,目前尚不清楚在特定语言上进行预训练能在多大程度上改善语言特定的语言信息。在此,我们测试了在自监督 Wav2Vec2 模型的内部表示中对荷兰语语音和词汇信息的编码。与在相似数量的英语或更大量的多语言数据上进行预训练相比,仅在荷兰语上进行预训练能改善荷兰语语言特征的表示。这种语言特定的优势可以被训练好的聚类或分类探针很好地检测到,并部分可通过零样本指标观察到。此外,语言特定性在语言特征编码上的优势与自动语音识别的下游性能相一致。
引用
@article{arxiv.2506.00981,
title = {What do self-supervised speech models know about Dutch? Analyzing advantages of language-specific pre-training},
author = {Marianne de Heer Kloots and Hosein Mohebbi and Charlotte Pouw and Gaofei Shen and Willem Zuidema and Martijn Bentum},
journal= {arXiv preprint arXiv:2506.00981},
year = {2025}
}
备注
Accepted to Interspeech 2025. For model, code, and materials, see https://github.com/mdhk/SSL-NL-eval