当Tom吃泡菜:评估多模态大语言模型在文化混合语境中的文化偏见
计算与语言
2025-03-24 v1
摘要
在高度全球化的世界中,多模态大语言模型(MLLMs)能够正确识别和响应混合文化输入非常重要。例如,模型应该能够正确识别图像中的泡菜(韩国食物),无论是一位亚洲女性在食用,还是一位非洲男性在食用。然而,当前的MLLM表现出对人物视觉特征的过度依赖,导致实体分类错误。为了检验MLLM对不同种族的鲁棒性,我们引入了MixCuBe,一个跨文化偏见基准,并研究了来自五个国家和四种族裔的元素。我们的发现表明,MLLM在高资源文化中既具有更高的准确率,又对此类扰动具有更低的敏感度,但在低资源文化中并非如此。GPT-4o作为整体表现最好的模型,在低资源文化中,在原始和扰动文化设置之间的准确率差异高达58%。我们的数据集公开可用,地址为:https://huggingface.co/datasets/kyawyethu/MixCuBe。
引用
@article{arxiv.2503.16826,
title = {When Tom Eats Kimchi: Evaluating Cultural Bias of Multimodal Large Language Models in Cultural Mixture Contexts},
author = {Jun Seong Kim and Kyaw Ye Thu and Javad Ismayilzada and Junyeong Park and Eunsu Kim and Huzama Ahmad and Na Min An and James Thorne and Alice Oh},
journal= {arXiv preprint arXiv:2503.16826},
year = {2025}
}
备注
12 pages