中文

打破基准:通过最小上下文增强揭示 LLM 演示偏差

计算与语言 2025-10-29 v1 机器学习

摘要

大型语言模型已被证明因其训练数据具有判别性而在表示和行为中表现出典型偏见。尽管在开发用于避免使用典型信息进行决策的方法和模型方面取得了显著进展,但最近的工作表明用于偏差对齐的方法脆弱。在本工作中,我们引入一种新型且通用的增强框架,包含三个可即插即用的步骤,适用于多种公平性评估基准。在将增强应用于公平性评估数据集(问题答案偏差基准(BBQ))时,我们发现包括最先进的开放和封闭权重模型的大型语言模型(LLMs)对其输入的扰动具有较大敏感性,表明其更容易表现出典型行为。此外,我们发现这些模型在目标人群属于文献较少研究的社区时,更倾向于表现出偏见,从而凸显了需要将公平性和安全研究扩展到更多样化社区的必要性。

关键词

引用

@article{arxiv.2510.23921,
  title  = {Breaking the Benchmark: Revealing LLM Bias via Minimal Contextual Augmentation},
  author = {Kaveh Eskandari Miandoab and Mahammed Kamruzzaman and Arshia Gharooni and Gene Louis Kim and Vasanth Sarathy and Ninareh Mehrabi},
  journal= {arXiv preprint arXiv:2510.23921},
  year   = {2025}
}

备注

9 pages, 3 figures, 3 tables