通过非歧视准则重构将公平性推广至生成式语言模型
计算与语言
2024-09-04 v3 人工智能
人机交互
摘要
生成式人工智能,如大型语言模型,近年来经历了快速发展。随着这些模型越来越多地向公众开放,人们开始担忧其在应用中会延续和放大有害的偏见。性别刻板印象无论表现为错误表征还是歧视,都可能对目标个体造成伤害和限制。认识到性别偏见是一种普遍存在的社会建构,本文研究了如何揭示和量化生成式语言模型中存在的性别偏见。特别地,我们从分类问题中推导出三个众所周知的非歧视准则——独立性、分离性和充分性——在生成式人工智能中的对应形式。为了展示这些准则的实际应用,我们针对每个准则设计了提示,重点关注职业性别刻板印象,并特别利用医学测试在生成式人工智能语境中引入真实情况。我们的结果揭示了此类对话式语言模型中存在的职业性别偏见。
引用
@article{arxiv.2403.08564,
title = {Generalizing Fairness to Generative Language Models via Reformulation of Non-discrimination Criteria},
author = {Sara Sterlie and Nina Weng and Aasa Feragen},
journal= {arXiv preprint arXiv:2403.08564},
year = {2024}
}