中文

GenFair:面向大语言模型公平性缺陷检测的系统性测试生成

软件工程 2025-06-04 v1

摘要

大语言模型(LLM)日益广泛地部署于关键领域,然而它们常表现出继承自训练数据的偏见,引发公平性担忧。本文聚焦于有效检测公平性违规的问题,尤其是常被现有基于模板和基于语法的测试方法所遗漏的交叉性偏见。先前的方法(如 CheckList 和 ASTRAEA)提供了结构化或语法驱动的测试生成,但在测试多样性低和对复杂人口统计交互的敏感性有限方面存在困难。为解决这些局限性,我们提出了 GenFair,这是一种蜕变公平性测试框架,利用等价类划分、变异算子和边界值分析系统地生成源测试用例。GenFair 通过生成语言上多样、真实且具有交叉性的测试用例来改进公平性测试。它应用蜕变关系(MR)推导后续用例,并通过源响应与后续响应之间基于语气的比较来检测公平性违规。在 GPT-4.0 和 LLaMA-3.0 的实验中,GenFair 优于两种基线方法。它实现了 0.73(GPT-4.0)和 0.69(LLaMA-3.0)的缺陷检测率(FDR),而基于模板的方法为 0.54/0.51,ASTRAEA 为 0.39/0.36。GenFair 还表现出最高的测试用例多样性(句法:10.06,语义:76.68)和强连贯性(句法:291.32,语义:0.7043),优于两种基线方法。这些结果证明了 GenFair 在揭示细微公平性违规方面的有效性。所提出的方法为公平性测试提供了可扩展的自动化解决方案,有助于构建更公平的 LLM。

关键词

引用

@article{arxiv.2506.03024,
  title  = {GenFair: Systematic Test Generation for Fairness Fault Detection in Large Language Models},
  author = {Madhusudan Srinivasan and Jubril Abdel},
  journal= {arXiv preprint arXiv:2506.03024},
  year   = {2025}
}