中文

租用你的提示词:面向 LLM 的专用性偏见与公平性评估

计算与语言 2026-05-12 v6 人工智能

摘要

大型语言模型 (LLM) 在不同部署情境下的偏见与公平性风险差异巨大,但现有方法缺乏针对性评估指标的系统性选择指导。我们提出一种决策框架,将 LLM 的应用场景(由模型和提示词集合构成)映射到基于任务类型、提示词是否包含受保护属性mention,以及利益相关者优先级的相关偏见与公平性指标。我们的框架涵盖毒性、刻板印象、反事实不公平以及分配性伤害,并引入基于刻板印象分类器和文本相似性度量的反事实调整新指标。我们发布了开源的 Python 库 \texttt{langfair} 以便实际应用。针对五个 LLM 和五个提示词集合的广泛实验表明,仅凭基准性能无法可靠评估公平性风险:一个提示词数据集的结果可能高估或低估另一个提示词数据的风险,这凸显公平性评估必须基于具体的部署情境。

关键词

引用

@article{arxiv.2407.10853,
  title  = {Bring Your Own Prompts: Use-Case-Specific Bias and Fairness Evaluation for LLMs},
  author = {Dylan Bouchard},
  journal= {arXiv preprint arXiv:2407.10853},
  year   = {2026}
}

备注

v6: Updated title; LangFair repository: https://github.com/cvs-health/langfair