中文

面向区域感知偏差评估指标的探索

计算与语言 2025-10-16 v2

摘要

当语言模型暴露于人类生成数据时,已知会学习并放大社会偏见。虽然先前工作引入了可用于评估这些模型偏见的基准测试,但它们依赖于可能不普遍适用的假设。例如,常用的性别偏见维度是家庭-职业,但这在世界某些地区可能并非唯一的常见偏见。在本文中,我们识别出不同地区之间性别偏见的主题差异,并提出一种面向区域的自下而上方法进行偏差评估。我们的方法使用给定区域的性别对齐主题,识别以主题对形式的性别偏见维度,这些主题对可能捕捉性别社会偏见。我们提议的若干性别主题对与人类对这些地区性别偏见的感知相当于现有的主题对,同时我们还识别了一些更符合这些地区的主题对。此外,我们在基于词嵌入关联测试(WEAT)的评估指标中使用区域感知偏见主题对,对不同数据领域中的不同地区测试性别偏见。我们也发现,LLMs在高度代表性地区的偏见配对上表现出更高的对齐性,这凸显了区域感知偏差评估指标的重要性。

关键词

引用

@article{arxiv.2406.16152,
  title  = {Towards Region-aware Bias Evaluation Metrics},
  author = {Angana Borah and Aparna Garimella and Rada Mihalcea},
  journal= {arXiv preprint arXiv:2406.16152},
  year   = {2025}
}

备注

Accepted to Cross-Cultural Considerations in NLP (C3NLP Workshop at NAACL 2025) -- Outstanding Paper Award