通过知识图谱增强训练检测和缓解LLM中的偏见
计算与语言
2025-04-02 v1 人工智能
摘要
大型语言模型凭借其惊人的理解和生成人类化文本的能力,彻底改变了自然语言处理领域。然而,这些模型继承并放大了其训练数据中存在的偏见,引发伦理和公平性担忧。其检测和缓解对于确保LLM在多样领域中负责任且公平地运行至关重要。本 work 探索了知识图谱增强训练(KGAT)作为缓解LLM中偏见的新方法。通过使用来自真实世界知识图谱的结构化领域特定知识,我们改进了模型的理解,减少了偏见性输出。用于偏见评估的公共数据集包括Gender Shades、Bias in Bios和FairFace,而度量如人口比例和平等机会有助于严格检测偏见。我们还采取了针对性的缓解策略以纠正偏见关联,导致偏见性输出显著下降,偏差指标得到改善。凭借真实世界数据集和知识图谱,我们的框架既可扩展又高效,为实现负责任的敏感和高风险应用铺平了道路。
引用
@article{arxiv.2504.00310,
title = {Detecting and Mitigating Bias in LLMs through Knowledge Graph-Augmented Training},
author = {Rajeev Kumar and Harishankar Kumar and Kumari Shalini},
journal= {arXiv preprint arXiv:2504.00310},
year = {2025}
}