在低代表性社会中标注数据集以量化偏置的挑战
计算与语言
2023-09-19 v1 人工智能
摘要
人工智能近期的进展,包括高度复杂的大语言模型(LLM)的发展,已在许多现实应用中证明有益。然而,这些LLM中编码的固有偏置证据引发了关于公平性的担忧。作为回应,涉及偏置的研究增多,包括聚焦量化偏置与开发去偏技术的研究。也已开发用于二元性别分类及伦理/种族考量的偏置基准数据集,主要聚焦美国人口统计。然而,关于理解和量化与低代表性社会相关偏置的研究极少。受缺乏用于量化低代表性社会偏置的标注数据集的驱动,我们着力为新西兰(NZ)人口创建基准数据集。尽管有三名标注者可用,我们在此过程中仍面临诸多挑战。本研究概述了人工标注流程,总结了遇到的挑战与经验教训,并给出了对未来研究的建议。
引用
@article{arxiv.2309.08624,
title = {Challenges in Annotating Datasets to Quantify Bias in Under-represented Society},
author = {Vithya Yogarajan and Gillian Dobbie and Timothy Pistotti and Joshua Bensemann and Kobe Knowles},
journal= {arXiv preprint arXiv:2309.08624},
year = {2023}
}
备注
Accepted in Ethics and Trust in Human-AI Collaboration: Socio-Technical Approaches @ The 32nd International Joint Conference on Artificial Intelligence