面向法语语言的端到端自动语音识别中的分词与自监督学习综合分析
计算与语言
2026-05-06 v1
摘要
端到端自动语音识别(ASR)系统的性能正在推动其在诸多应用中的日益增多的集成。尽管存在这些语音到文本系统的诸多好处,但超参数和模型选择在其性能中扮演着关键角色。通常,这些选择仅基于字符错误率(CER)和/或词错误率(WER)指标进行确定。然而,已有研究表明,这些指标在充分描述自动转录的下游应用方面大体不完整。本文对法语语言进行定性研究,探讨子词分词算法和来自不同语言学和声学视角的自监督学习模型的影响,采用全面且多样的评估指标。
引用
@article{arxiv.2605.03696,
title = {A Comprehensive Analysis of Tokenization and Self-Supervised Learning in End-to-End Automatic Speech Recognition applied on French Language},
author = {Thibault Bañeras-Roux and Mickael Rouvier and Jane Wottawa and Richard Dufour},
journal= {arXiv preprint arXiv:2605.03696},
year = {2026}
}