BharatBBQ:面向印度语境的多语言偏见基准测试集
计算与语言
2025-08-12 v1
摘要
评估语言模型中的社会偏见对于确保公平性并减少AI系统中有害刻板印象的强化至关重要。现有基准测试(如偏见问答基准测试BBQ)主要关注西方语境,限制了其在印度语境中的适用性。为此,我们引入BharatBBQ,一个为印度语境量身定制的基准测试,旨在评估偏见,涵盖印地语、英语、马拉拉语、孟加拉语、泰米尔语、泰卢固语、奥利亚语和阿萨姆语。BharatBBQ覆盖13个社会类别,包括3个交叉性群体,反映了印度社会文化背景中常见的偏见。该数据集包含单一语言中的49,108个样本,通过翻译和验证扩展至八种语言共392,864个样本。我们评估了五个多语言语言模型家族在零样本和少样本设置下的偏见及其刻板偏见得分。我们的发现表明,偏见在不同语言和社会类别中均存在持续性,印度语言相对于英语往往放大了偏见,这表明在偏见评估中亟需基于语言和文化的扎实基准测试。
引用
@article{arxiv.2508.07090,
title = {BharatBBQ: A Multilingual Bias Benchmark for Question Answering in the Indian Context},
author = {Aditya Tomar and Nihar Ranjan Sahoo and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:2508.07090},
year = {2025}
}