中文

利用拓扑数据分析增强大语言模型中的偏见检测

计算与语言 2025-08-12 v1

摘要

近期,许多偏见检测方法被提出,用于确定大语言模型所捕获的偏见水平。然而,用于识别大语言模型中哪些部分对特定群体的偏见负责的测试仍不成熟。在本研究中,我们提出了一种使用拓扑数据分析的方法,以识别GPT-2中哪些注意力头导致了StereoSet数据集中存在的身份群体错误表征。我们发现,针对特定类别(如性别或职业)的偏见集中在充当热点的注意力头上。我们提出的度量标准也可用于确定哪些头捕获了偏见类别中特定群体的偏见,未来的工作可将此方法扩展以帮助消除大语言模型中的偏见。

关键词

引用

@article{arxiv.2508.07516,
  title  = {Augmenting Bias Detection in LLMs Using Topological Data Analysis},
  author = {Keshav Varadarajan and Tananun Songdechakraiwut},
  journal= {arXiv preprint arXiv:2508.07516},
  year   = {2025}
}

备注

15 pages, 9 figures, 4 tables