面向全模态语言模型的人口学与语言偏见评估
计算机视觉与模式识别
2026-04-14 v1 人工智能
计算与语言
摘要
本文对人口学与语言偏见在处理文本、图像、音频和视频于单一框架内的全模态语言模型进行了全面评估。尽管这些模型正在被广泛部署,但其在不同人口学群体和模态上的表现尚未得到充分研究。评估了四个全模态模型,其任务包括人口学属性估计、身份验证、活动识别、多语言语音转录和语言识别。测量在年龄、性别、肤色、语言和国籍方面的准确率差异。结果显示,图像和视频理解任务通常表现出较小的人口学差异;而相比之下,音频理解任务表现显著低下且存在显著偏见,包括年龄、性别和语言之间巨大的准确率差异,以及频繁向狭窄类别预测崩溃。这些发现凸显了在全模态语言模型日益广泛应用于实际应用的背景下,跨所有支持模态的公平性评估的重要性。
引用
@article{arxiv.2604.10014,
title = {Demographic and Linguistic Bias Evaluation in Omnimodal Language Models},
author = {Alaa Elobaid},
journal= {arXiv preprint arXiv:2604.10014},
year = {2026}
}
备注
Accepted at ICPR 2026. Full paper with complete appendix (31 pages total)