FairPy:用于评估大语言模型中预测偏差及其缓解的工具包
计算与语言
2025-04-16 v2 人工智能
机器学习
摘要
最近的研究表明,BERT和GPT-2等大型预训练语言模型(LLMs)在词元预测中表现出偏差,这些偏差通常继承自其训练语料库中的数据分布。为此,人们提出了许多数学框架来量化、识别并缓解这些有偏词元预测的可能性。在本文中,我们针对BERT、GPT-2等广泛使用的LLM,对这类技术进行了全面综述。此外,我们介绍了Fairpy,一个模块化且可扩展的工具包,提供即插即用的接口以集成这些数学工具,使用户能够评估预训练模型和自定义语言模型。Fairpy支持现有去偏算法的实现。该工具包是开源的,公开地址为:\href{https://github.com/HrishikeshVish/Fairpy}{https://github.com/HrishikeshVish/Fairpy}
引用
@article{arxiv.2302.05508,
title = {FairPy: A Toolkit for Evaluation of Prediction Biases and their Mitigation in Large Language Models},
author = {Hrishikesh Viswanath and Tianyi Zhang},
journal= {arXiv preprint arXiv:2302.05508},
year = {2025}
}