拉美社区来源评估刻板印象的自适应数据收集
计算机与社会
2026-01-07 v2
摘要
评估 NLP 模型中社会偏见的过程,受到地区文化差距的严重阻碍。这使得像拉美地区这样的地区被严重忽视,无法对语言技术中持续传播的有害地区刻板印象进行充分评估或消除。本文提出了 LACES(Latin-American Community-sourced Evaluation of Stereotypes),一个用于 15 个拉美国家的刻板印象关联数据集。该数据集包含 4,789 条由 83 名参与者手动创建和标注的刻板印象关联。数据集通过拉美地区的针对性社区合作伙伴关系开发。此外,本文提出了一种新颖的自适应数据收集方法,独特地将新的刻板印象条目来源化与现有数据验证集成到单一、统一的工作流程中。这种方法产生的资源比以前的静态收集方法具有更多独特刻板印象,从而实现更高效的刻板印象收集。本文进一步通过表明去偏方法在本数据集上的效果低于现有流行刻板印象基准,来支持 LACES 的质量。
引用
@article{arxiv.2510.24958,
title = {Adaptive Data Collection for Latin-American Community-sourced Evaluation of Stereotypes (LACES)},
author = {Guido Ivetta and Pietro Palombini and Sofía Martinelli and Marcos J Gomez and M. María Echeveste and Sunipa Dev and Vinodkumar Prabhakaran and Luciana Benotti},
journal= {arXiv preprint arXiv:2510.24958},
year = {2026}
}