当更少更好?通过层级解码诊断 Sardinian ASR 预测
计算与语言
2026-02-12 v1
摘要
最近的研究表明,多语言语音模型的中间层通常比最终输出层更准确地编码语音特征。在本工作中,我们将层级解码策略应用于预训练的 Wav2Vec2 模型,以探讨语音模型中语音单元级别预测随编码器层的演化,专注于低资源语言 Campidanese Sardinian。我们展示,截断上层 transformer 层会导致改进的语音单元错误率(PER),最佳性能并非在最终层,而在后两层实现。通过细粒度对齐分析,我们发现中间预测更好地保留段落身份,避免过度生成,并减少某些类语音学错误。我们还引入了“倒退错误”的概念,即在最终层中被正确预测覆盖的错误情况。这些倒退突显了表层误差指标的局限性,揭示了更深层如何泛化或抽象化声学细节。我们的发现支持使用早期层探测作为诊断 ASR 模型的工具,尤其是在标准评估指标可能无法捕捉语言上有意义行为的低资源环境中。
引用
@article{arxiv.2602.10350,
title = {When Less Is More? Diagnosing ASR Predictions in Sardinian via Layer-Wise Decoding},
author = {Domenico De Cristofaro and Alessandro Vietti and Marianne Pouplier and Aleese Block},
journal= {arXiv preprint arXiv:2602.10350},
year = {2026}
}