中文

检索增强生成中的公平性测试:小扰动如何揭示小语言模型中的偏见

人工智能 2025-10-01 v1 信息检索 机器学习 软件工程

摘要

大语言模型(LLMs)广泛应用于多个领域,但仍然引发有关安全性和公平性的担忧。除了已知攻击向量如数据投毒和提示注入外,LLMs还存在公平性缺陷。这些指由敏感人口统计线索(如种族或性取向)影响的不应影响结果的行为。另一个关键问题是幻觉,即模型生成看似合理但虚假的信息。检索增强生成(RAG)已成为一种通过结合外部检索与文本生成来缓解幻觉的策略。然而,其采用引发了新的公平性担忧,因为检索内容本身可能暴露或放大偏见。本研究通过变元测试(MT)进行公平性测试,在提示中引入受控的人口统计扰动,以评估三个托管在HuggingFace上的小语言模型(SLMs)(Llama-3.2-3B-Instruct、Mistral-7B-Instruct-v0.3和Llama-3.1-Nemotron-8B)在情感分析中的公平性,每个模型均集成到RAG流水线中。结果表明,微小的人口统计变化可能破坏多达三分之一的变元关系(MRs)。对这些失败的详细分析揭示了一致的偏见层级,涉及种族线索的扰动是违规的主要原因。除了提供比较评估外,这项工作还强化了RAG中的检索组件必须经过仔细策划以防止偏见放大的观点。这些发现为希望在不损害公平性或可靠性的前提下采用可访问SLMs的开发者、测试者和小型组织提供了实践警示。

关键词

引用

@article{arxiv.2509.26584,
  title  = {Fairness Testing in Retrieval-Augmented Generation: How Small Perturbations Reveal Bias in Small Language Models},
  author = {Matheus Vinicius da Silva de Oliveira and Jonathan de Andrade Silva and Awdren de Lima Fontao},
  journal= {arXiv preprint arXiv:2509.26584},
  year   = {2025}
}