中文

语音基石模型中的声学质量变异:用于评估的维度

音频与语音处理 2025-10-30 v1 人工智能 计算与语言

摘要

语音基石模型(SFM)的近期进展使其能够直接从原始音频处理语言,绕过中间文本表示。这一能力使 SFM 能够暴露于输入语音信号中嵌入的丰富的非语音变异,并可能作出相应的响应。非语音变异的一个未充分探索的维度是声学质量,包含如颤音和气声等语音类型。这些语音类型已知会影响听者推断情感状态、立场及社会意义的方式。现有的语音理解基准主要依赖多选问答(MCQA)格式,这些格式容易出错,因而不可靠地捕捉非语音特征如何影响模型行为。本文通过开放式生成任务和语音情感识别来探测 SFM,评估模型行为在不同的语音输入下是否一致。我们引入了一个新的平行数据集,包含对声学质量的合成修改,旨在评估 SFM 对颤音和气声的响应。我们的工作提供了对 SFM 对这些特定非词汇化语音感知方面敏感性的首次检验。

关键词

引用

@article{arxiv.2510.25577,
  title  = {Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models},
  author = {Harm Lameris and Shree Harsha Bokkahalli Satish and Joakim Gustafson and Éva Székely},
  journal= {arXiv preprint arXiv:2510.25577},
  year   = {2025}
}

备注

8 pages, 3 figures, 4 tables, submitted to LREC 2026