同意与不同意?LLM 误性别化的元评估
计算与语言
2025-08-05 v2 计算机与社会
摘要
已提出诸多方法来衡量LLM 误性别化,包括基于概率的评估(例如,使用模板句自动评估)和基于生成的评估(例如,使用自动启发式方法或人类验证)。然而,尚未检视这些评估方法是否具有收敛性,即它们的结果是否一致。因此,我们对这些方法进行系统的元评估,涵盖三个现有的LLM 误性别化数据集。我们提出一种方法将每个数据集转换为可实现的概率和生成-based 评估的平行形式。然后,通过自动评估来自 6 个模型的 3 个家族,我们发现这些方法在实例、数据集和模型层面上可以相互不同步,在 20.2% 的评估实例上产生冲突。最终,针对 2400 个LLM 生成的人类评估显示,误性别化行为远超代词,这些自动评估目前并不旨在捕获这一点,表明其与人类评估存在根本性不一致。基于我们的发现,我们为未来的LLM 误性别化评估提供了建议。我们的结果也更广泛地相关,因为它们质疑了LLM 评估中常常假设不同评估方法一致的更广泛方法论惯例。
引用
@article{arxiv.2504.17075,
title = {Agree to Disagree? A Meta-Evaluation of LLM Misgendering},
author = {Arjun Subramonian and Vagrant Gautam and Preethi Seshadri and Dietrich Klakow and Kai-Wei Chang and Yizhou Sun},
journal= {arXiv preprint arXiv:2504.17075},
year = {2025}
}
备注
Accepted to COLM 2025