VIBE:基于真实语音评估大型音频-语言模型中的偏见
音频与语音处理
2026-04-21 v1 计算与语言
声音
摘要
大型音频-语言模型(LALM)正逐步融入日常应用,但其生成性偏见仍未得到充分探讨。现有语音公平性基准依赖合成语音和多选题(MCQs),两者都提供片面化的公平性视角。我们提出VIBE框架,通过开放式任务(如个性化推荐)评估生成式偏见,任务使用真实语料。不同于MCQs,VIBE允许偏见关联自然显现,无需预设选项,从而易于扩展至新任务。评估11个最先进LALM后,我们发现现实情境中存在系统性偏见。我们发现性别线索常导致分布性偏移远大于语音腔调线索,表明当前LALM复刻了社会偏见。
引用
@article{arxiv.2604.17248,
title = {VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech},
author = {Yi-Cheng Lin and Yusuke Hirota and Sung-Feng Huang and Hung-yi Lee},
journal= {arXiv preprint arXiv:2604.17248},
year = {2026}
}
备注
Submitted to INTERSPEECH 2026