中文

StressTest:你的语音语言模型能处理重音吗?

计算与语言 2026-04-08 v3 声音 音频与语音处理

摘要

句子重音是指对口语话语中的某些词加以强调,以突出或对比某个观点。它常被用来暗示未明确陈述的潜在意图。近期具备语音感知能力的语言模型(SLM)实现了直接音频处理,使模型能够获取语音的全部丰富信息以执行音频推理任务,如口语问答。尽管句子重音在塑造含义和意图方面起着关键作用,但在 SLM 的评估与开发中却很大程度上被忽视。我们通过引入 StressTest 来填补这一空白,这是一个旨在评估模型区分基于重音模式的语音含义能力的基准。我们评估了领先的 SLM,发现尽管它们具备整体能力,但在此类任务上表现不佳。因此,我们提出了一种新颖的数据生成流水线,并创建了 Stress-17k,一个模拟由重音变化所隐含含义变化的训练集。结果表明,我们微调过的模型 StresSLM 能很好地泛化到真实录音,并在句子重音推理与检测上显著优于现有的 SLM。模型、代码、数据、样本见 pages.cs.huji.ac.il/adiyoss-lab/stresstest。

关键词

引用

@article{arxiv.2505.22765,
  title  = {StressTest: Can YOUR Speech LM Handle the Stress?},
  author = {Iddo Yosha and Gallil Maimon and Yossi Adi},
  journal= {arXiv preprint arXiv:2505.22765},
  year   = {2026}
}

备注

Accepted to ACL 2026