CatRAG:面向公平LLM的函子引导结构去偏与检索增强
计算与语言
2026-03-24 v1 人工智能
摘要
大型语言模型(LLM)在高风险场景中被广泛部署,但会显示出损害公平性与信任的民族、性别与地理偏见。先前的去偏方法(包括嵌入空间投影、提示词引导及因果干预)常仅在管道单一阶段发挥作用,导致偏见缓解不完全且在分布迁移下面临实用性权衡。我们提出CatRAG去偏,一种双轨框架,将函子与检索增强生成(RAG)结合,以结构化方式去偏。函子组件利用范畴论结构,实施原则性、结构保持的投影,以抑制与偏见关联的方向,同时保留任务相关语义。在针对三个开源LLM(Meta Llama-3、OpenAI GPT-OSS及Google Gemma-3)的问答偏见基准(BBQ)上,CatRAG实现最先进的成绩,在准确率上较基线模型提升最高可达40%,较先前去偏方法提升超过10%,同时将偏见分数降至接近零(基线模型为60%),覆盖性别、国籍、种族及交叉子群。
引用
@article{arxiv.2603.21524,
title = {CatRAG: Functor-Guided Structural Debiasing with Retrieval Augmentation for Fair LLMs},
author = {Ravi Ranjan and Utkarsh Grover and Mayur Akewar and Xiaomin Lin and Agoritsa Polyzou},
journal= {arXiv preprint arXiv:2603.21524},
year = {2026}
}
备注
9 pages, 4 figures, and accepted in IJCNN 2026 (part of IEEE WCCI 2026)