超越二进制审核:使用大语言模型在 GitHub 上识别细粒度的性别歧视和偏性行为
软件工程
2025-07-29 v1
摘要
背景:性别歧视和偏性行为严重阻碍了像 GitHub 这样的技术社区的包容性,导致开发者(尤其是少数派)因细微偏见和微攻击而离开。当前的审核工具主要依赖关键词过滤或二元分类器,限制了其有效检测细微伤害的能力。目标:本研究引入一种细粒度的多类分类框架,利用指令调优型大语言模型(LLM)识别 GitHub 上十二种不同类别的性别歧视和偏性评论。方法:我们利用指令调优型大语言模型框架,经过 20 次系统性提示优化,在 1,440 条标注的 GitHub 评论(涵盖十二个性别歧视/偏性类别)上进行评估。使用精确率、召回率、F1 分数和 Matthews 相关系数(MCC)进行模型性能的严格比较。结果:我们优化的方法(GPT-4o 使用提示 19)实现了 MCC 为 0.501,显著优于基线方法。虽然该模型的误报率较低,但在可靠地解释细微、情境依赖性的性别歧视和偏性方面存在挑战。结论:经过精心设计的提示,包含清晰定义和结构化输出,显著提高了性别歧视检测的准确度和可解释性,使在像 GitHub 这样的开发者平台上进行精确且实用的审核成为可能。
引用
@article{arxiv.2507.20358,
title = {Beyond Binary Moderation: Identifying Fine-Grained Sexist and Misogynistic Behavior on GitHub with Large Language Models},
author = {Tanni Dev and Sayma Sultana and Amiangshu Bosu},
journal= {arXiv preprint arXiv:2507.20358},
year = {2025}
}
备注
The 19th ACM/IEEE International Symposium on Empirical Software Engineering and Measurement