中文

QueerBench:量化语言模型针对 Queer 身份的歧视

计算与语言 2024-06-19 v1 人工智能 计算机与社会

摘要

随着自然语言处理(NLP)在 various applications 中的日益重要作用,关于偏见和刻板印象的挑战日益凸显,这常常导致仇恨言论和伤害。尽管已有研究关注性别歧视和女性迫害,但关于 homophobia 和 transphobia 的问题仍未得到充分探索,常采用二元视角,这将LGBTQIA+ 成员的安全风险置于高风险的在线空间之中。在本文中,我们评估了英文大型语言模型(LLM)生成的关于 LGBTQIA+ 成员的句子完成所导致的潜在伤害。这是通过我们新的评估框架 QueerBench 实现的,该框架采用基于模板的方法和屏蔽语言模型(MLM)任务。分析表明,大型语言模型倾向于更频繁地表现出对LGBTQIA+ 社区成员的歧视行为,其 harmfulness 的 QueerBench 分数差距可达7.2%。

关键词

引用

@article{arxiv.2406.12399,
  title  = {QueerBench: Quantifying Discrimination in Language Models Toward Queer Identities},
  author = {Mae Sosto and Alberto Barrón-Cedeño},
  journal= {arXiv preprint arXiv:2406.12399},
  year   = {2024}
}