中文

说出你的想法:语音延续任务作为基于语音的模型偏差探测

音频与语音处理 2026-05-19 v2 计算与语言 声音

摘要

语音延续(SC)任务是在保留语义上下文和说话人身份的同时生成语音提示的连贯扩展。由于 SC 仅限于单条音频流,它为探测语音基础模型中的偏差提供了比对话更直接的设定。在本工作中,我们首次系统性地评估了 SC 中的偏差,调查性别和发声类型(气声、粗声、末尾嘎声)如何影响延续行为。我们评估了三个近期模型:SpiritLM(基础版和表达版)、VAE-GSLM 和 SpeechGPT,在说话人相似性、语音质量保持和基于文本的偏差指标方面进行衡量。结果表明,虽然说话人相似性和连贯性仍然是挑战,但文本评估揭示了显著的模型与性别交互效应:一旦连贯性足够高(对于 VAE-GSLM),性别效应在文本指标(如主体性和句子极性)上显现出来。此外,延续结果对于女性提示比男性提示更强烈地回归到模态发声,揭示了一种系统性的语音质量偏差。这些发现凸显了 SC 作为语音基础模型中社会相关表示性偏差的受控探测手段,并表明随着延续质量的提升,它将成为一个日益信息丰富的诊断工具。

关键词

引用

@article{arxiv.2509.22061,
  title  = {Speak Your Mind: The Speech Continuation Task as a Probe of Voice-Based Model Bias},
  author = {Shree Harsha Bokkahalli Satish and Harm Lameris and Olivier Perrotin and Gustav Eje Henter and Éva Székely},
  journal= {arXiv preprint arXiv:2509.22061},
  year   = {2026}
}

备注

8 pages, 2 figures, Accepted to Identity-Aware AI LREC Workshop 2026