减轻大语言模型中酷儿表征的偏见:一种协作智能体方法
计算与语言
2024-12-03 v2 多智能体系统
摘要
大语言模型(LLMs)常在代词使用中延续偏见,导致对酷儿个体的错误表征或排除。本文针对LLM输出中代词使用偏见的具体问题,特别是在需要包容性语言以准确表征所有身份时,不当使用传统性别代词(“他”、“她”)的问题。我们引入了一个协作智能体流水线,旨在通过分析和优化代词使用以实现包容性,从而减轻这些偏见。我们的多智能体框架包含专门用于偏见检测和纠正的智能体。使用Tango数据集(一个专注于性别代词使用的基准)的实验评估表明,我们的方法显著提高了包容性代词分类,在正确反对不当传统性别代词方面比GPT-4o提高了32.6个百分点(χ² = 38.57, p < 0.0001)。这些结果凸显了智能体驱动框架在增强AI生成内容的公平性和包容性方面的潜力,证明了其在减少偏见和促进社会责任AI方面的功效。
引用
@article{arxiv.2411.07656,
title = {Mitigating Bias in Queer Representation within Large Language Models: A Collaborative Agent Approach},
author = {Tianyi Huang and Arya Somasundaram},
journal= {arXiv preprint arXiv:2411.07656},
year = {2024}
}
备注
NeurIPS 2024 Queer in AI Workshop