中文

面向菲律宾的偏见基准FilBBQ:面向问答语言模型的鲁棒性偏见评估

计算与语言 2026-04-21 v2

摘要

随着自然语言生成成为语言模型的热门应用场景,针对生成式模型所表现出的刻板印象关联的 Bias Benchmark for Question-Answering (BBQ) 正逐渐成为重要的基准测试格式。我们扩充了BBQ的语言学范围,通过四阶段的开发流程构建FilBBQ,包括模板分类、文化敏感翻译、新模板构建和提示生成。这些过程导致了一个包含超过10,000个提示的偏见测试,用于评估模型在菲律宾语境下是否展现出与性别歧视和异装者偏见相关的刻板印象。我们随后对在菲律宾语中训练的模型应用FilBBQ,但同时采用鲁棒的评估协议,以提高此前BBQ实现的可靠性和准确性。具体而言,我们通过在多个随机种子下获取提示的响应并对这些不同随机种子运行计算的偏见分数进行平均,来消除模型响应不稳定性。我们的结果确认了不同随机种子下偏见分数存在变异性,以及情感、家务、刻板印象中性别兴趣以及多配偶制等方面的性别歧视和异装者偏见。FilBBQ可通过 https://github.com/gamboalance/filbbq 获取。

关键词

引用

@article{arxiv.2602.14466,
  title  = {Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language Models},
  author = {Lance Calvin Lim Gamboa and Yue Feng and Mark Lee},
  journal= {arXiv preprint arXiv:2602.14466},
  year   = {2026}
}

备注

Accepted in LREC 2026