一种多语言、文化优先的方法来解决 LLM 应用中的性别误称问题
计算与语言
2025-05-22 v2 人工智能
摘要
性别误称是指用不符合个人选择身份的性别来指代某人。它边缘化并削弱了个人的自我认同感,造成严重伤害。基于英语的方法有明确的避免性别误称的策略,例如使用代词“they”。然而,其他语言由于语法和文化结构而带来独特的挑战。在这项工作中,我们开发了评估和缓解 42 种语言和方言中性别误称的方法,采用参与式设计方法设计跨所有语言有效且适当的防护措施。我们在一个标准的基于 LLM 的应用(会议记录摘要)中测试了这些防护措施,其中数据生成和注释步骤都遵循人在回路的方法。我们发现,所提出的防护措施在减少所有语言生成的摘要中的性别误称率方面非常有效,且不会导致质量损失。我们的人在回路方法展示了一种可行的方法,可以在多种语言和文化中扩展包容性和负责任的基于 AI 的解决方案。我们发布了涵盖 42 种语言的防护措施和合成数据集,以及人工和 LLM 评估结果,以鼓励对该主题的进一步研究。
引用
@article{arxiv.2503.20302,
title = {A Multilingual, Culture-First Approach to Addressing Misgendering in LLM Applications},
author = {Sunayana Sitaram and Adrian de Wynter and Isobel McCrum and Qilong Gu and Si-Qing Chen},
journal= {arXiv preprint arXiv:2503.20302},
year = {2025}
}