中文

它们真正理解了吗?对大型语言模型中非二元代词处理的最新评估

计算与语言 2025-08-04 v1 人工智能

摘要

大型语言模型 (LLMs) 正在越来越多地部署在公平性和包容性至关重要的情境中。代词的使用,尤其是涉及性别中性和新型代词的使用,仍是负责任 AI 的关键挑战。先前的工作,如 MISGENDERED 基准,揭示了早期 LLMs 在包容性代词处理方面的显著局限性,但仅限于过时的模型和有限的评估。在本研究中,我们引入了 MISGENDERED+,用于评估 LLMs 对代词忠诚度的扩展且更新的基准。我们对五个具有代表性的 LLMs(GPT-4o、Claude 4、DeepSeek-V3、Qwen Turbo 和 Qwen2.5)进行基准测试,涵盖 zero-shot、few-shot 和性别身份推断。在我们的结果显示,与以前的研究相比,在二进制代词和性别中性代词的准确性取得了显著提高。然而,关于 new 代词和 reverse 推断任务的准确性仍不一致,这凸显了在身份敏感推理方面仍存下的差距。我们讨论了含义、模型特定观察以及未来包容 AI 研究的 avenues。

关键词

引用

@article{arxiv.2508.00788,
  title  = {Do They Understand Them? An Updated Evaluation on Nonbinary Pronoun Handling in Large Language Models},
  author = {Xushuo Tang and Yi Ding and Zhengyi Yang and Yin Chen and Yongrui Gu and Wenke Yang and Mingchen Ju and Xin Cao and Yongfei Liu and Wenjie Zhang},
  journal= {arXiv preprint arXiv:2508.00788},
  year   = {2025}
}