中文

偏见前瞻:大语言模型公平性中的敏感提示作为早期预警

软件工程 2026-04-08 v1

摘要

大语言模型(LLMs)正越来越多地集成到软件系统中,提供了强大的能力,但也引发了公平性方面的担忧。然而,现有的公平性基准测试聚焦于刻板印象特定的关联,这限制了它们在多样化真实世界场景中预判风险的能力。在本文中,我们提出敏感提示作为公平性评估的新抽象:那些本身不具有偏见但由于其内容的敏感性而更可能引发偏见或不充分响应的输入。我们构建并发布了SensY,一个包含12,801个提示的数据集,被分类为敏感和非敏感,涵盖七个主题领域,结合了合成生成和真实用户输入。使用该数据集,我们查询了三个开源LLM并手动分析了4,500个响应,以评估它们在回答敏感提示方面的充分性。结果表明,虽然模型通常提供事实正确的答案,但它们经常未能承认敏感输入的伦理、关系或语境含义。此外,我们开发了一个用于预测提示敏感性的自动分类器,在敏感提示上取得了稳健的性能。我们的发现表明,提示敏感性可以作为LLM中公平性风险的有效早期预警机制。这一视角将公平性评估从被动缓解转向预防设计,使开发者能够在部署前预判和管理偏见。

关键词

引用

@article{arxiv.2604.05575,
  title  = {Bias Ahead: Sensitive Prompts as Early Warnings for Fairness in Large Language Models},
  author = {Gianmario Voria and Martina De Lucia and Alessandra Raia and Andrea De Lucia and Gemma Catolino and Fabio Palomba},
  journal= {arXiv preprint arXiv:2604.05575},
  year   = {2026}
}