中文

VIBE:基于真实语音评估大型音频-语言模型中的偏见

音频与语音处理 2026-04-21 v1 计算与语言 声音

摘要

大型音频-语言模型(LALM)正逐步融入日常应用,但其生成性偏见仍未得到充分探讨。现有语音公平性基准依赖合成语音和多选题(MCQs),两者都提供片面化的公平性视角。我们提出VIBE框架,通过开放式任务(如个性化推荐)评估生成式偏见,任务使用真实语料。不同于MCQs,VIBE允许偏见关联自然显现,无需预设选项,从而易于扩展至新任务。评估11个最先进LALM后,我们发现现实情境中存在系统性偏见。我们发现性别线索常导致分布性偏移远大于语音腔调线索,表明当前LALM复刻了社会偏见。

关键词

引用

@article{arxiv.2604.17248,
  title  = {VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech},
  author = {Yi-Cheng Lin and Yusuke Hirota and Sung-Feng Huang and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2604.17248},
  year   = {2026}
}

备注

Submitted to INTERSPEECH 2026