CulturalBench:通过人类-人工文化团队合作构建的稳健、多样且具挑战性的文化基准
计算与语言
2025-06-04 v2 人工智能
机器学习
摘要
稳健、多样且具挑战性的文化知识基准对于实现跨文化都有帮助的大语言模型(LM)的进展至关重要。我们引入CulturalBench:一个包含1696个人工书写和人工验证问题的数据集,用于评估大语言模型的文化知识,覆盖45个全球地区,包括如孟加拉、赞比亚和秘鲁等被边缘化地区。每个问题都由五位独立标注者验证,涵盖17个多样化主题,从食物偏好到问候礼仪。我们受人类-人工红队测试启发,构建了CulturalBench。与人类水平(92.4%准确率)相比,CulturalBench的难版本即使对最佳表现的前沿大语言模型也具有挑战性,其准确率范围为28.7%至61.5%。我们发现,大语言模型在那些具有多个正确答案的棘手问题上常常困难处理(例如:中国人通常使用什么餐具?),表现出过度依赖单一答案的倾向。我们的结果表明,GPT-4o在跨文化方面显著优于其他模型,超过了当地提供商(例如Mistral在欧洲文化方面,DeepSeek在中国文化方面)。在所有问题上,模型在北非、南美和中东的问题表现不佳。
引用
@article{arxiv.2410.02677,
title = {CulturalBench: A Robust, Diverse, and Challenging Cultural Benchmark by Human-AI CulturalTeaming},
author = {Yu Ying Chiu and Liwei Jiang and Bill Yuchen Lin and Chan Young Park and Shuyue Stella Li and Sahithya Ravi and Mehar Bhatia and Maria Antoniak and Yulia Tsvetkov and Vered Shwartz and Yejin Choi},
journal= {arXiv preprint arXiv:2410.02677},
year = {2025}
}
备注
ACL 2025 Main, 39 pages, 16 figures. arXiv admin note: text overlap with arXiv:2404.06664