中文

语音基础模型学到了什么?分析与应用

计算与语言 2025-08-19 v1 音频与语音处理

摘要

语音基础模型(SFM)旨在为广泛的语音处理任务提供通用表征。过去五年间,涌现出越来越多成功的自监督和监督预训练模型,它们在各种下游任务中表现出色。尽管SFM的种类持续增长,但我们对它们所获取知识的理解却相对滞后。本论文提出了一个轻量级分析框架,利用统计工具和无训练任务来研究编码在SFM层中的声学和语言学知识。我们对多个SFM和统计工具进行了比较研究。我们的研究还表明,这些分析见解对下游任务性能具有具体影响。SFM的有效性最终取决于其在语音应用上的表现。然而,目前尚不清楚这些优势是否扩展到需要比广泛研究的任务(如语音识别)更深层次理解的口语语言理解(SLU)任务。对SLU的探索有限,主要是由于缺乏相关数据集。为了缓解这一问题,本论文为口语语言理解评估基准贡献了任务,特别是口语命名实体识别(NER)和命名实体定位(NEL)。我们开发了基于SFM的NER和NEL方法,并发现利用SFM的端到端(E2E)模型可以超越传统的级联(语音识别后接文本模型)方法。此外,我们跨SFM和适应策略评估了E2E SLU模型,以评估其对任务性能的影响。总的来说,本论文解决了关于SFM先前未解答的问题,提供了工具和数据集以加深我们的理解,并使社区能够为未来的模型开发和采用做出明智的设计选择。

关键词

引用

@article{arxiv.2508.12255,
  title  = {What do Speech Foundation Models Learn? Analysis and Applications},
  author = {Ankita Pasad},
  journal= {arXiv preprint arXiv:2508.12255},
  year   = {2025}
}

备注

Ph.D. Thesis