向大规模多语言整体偏见迈进
计算与语言
2024-07-02 v1
摘要
在自动语言生成的当前格局中, 有必要理解、评估和缓解人口统计偏见, 因为现有模型正变得越来越多语言。为此, 我们呈现了来自 MASSIVE MULTILINGUAL HOLISTIC BIAS (MMHB) 数据集和基准测试的初始八种语言, 约 600 万句子代表 13 个人口统计轴向。我们提出了自动构建方法, 以利用有限的人类标注进一步扩展 MMHB 的句子在语言覆盖范围和规模方面。该方法利用多语言句子构建中的占位符, 并采用系统方法独立翻译句子模式、名词和描述符。结合人类翻译, 这一技术仔细设计占位符以动态生成多种句子变体, 大幅减少人类翻译工作量。翻译过程严格遵循规范, 以避免以英语为中心的视角, 并包含所有必要的形态变化, 以改进原始英语 HOLISTICBIAS。最终我们利用 MMHB 在性别偏见和机器翻译中添加的有毒性方面进行报告。对于性别分析, MMHB 揭示了: (1) 性别鲁棒性不足, 平均显示出近乎 +4 chrf 分点针对 masculine 语义句子与女性句子; (2) 偏好过度概括为 masculine 形式, 评估时以 masculine 参考相较于女性参考平均显示超过 +12 chrf 分点。MMHB 触发添加的有毒性最高达 2.3%。
引用
@article{arxiv.2407.00486,
title = {Towards Massive Multilingual Holistic Bias},
author = {Xiaoqing Ellen Tan and Prangthip Hansanti and Carleigh Wood and Bokai Yu and Christophe Ropers and Marta R. Costa-jussà},
journal= {arXiv preprint arXiv:2407.00486},
year = {2024}
}