中文

IndiCASA:基于印度语境下对比嵌入相似性的 LLM 偏见评估数据集与框架

计算与语言 2025-10-06 v1

摘要

大型语言模型(LLM)因其出色的上下文理解和生成能力而在关键领域获得了显著的关注。然而,其日益增长的部署在高风险应用中 necessitates 对嵌入偏见的严格评估,尤其是在像印度这样文化多样化的语境中,现有的基于嵌入的方法往往难以捕捉细微的刻板印象。我们提出了一个基于使用对比学习训练的编码器的评估框架,通过嵌入相似性捕捉细粒度的偏见。我们还引入了一个新数据集——IndiCASA(IndiBias-based Contextually Aligned Stereotypes and Anti-stereotypes),包含2,575个人类验证的句子,涵盖五个人口统计轴向:种姓、性别、宗教、残疾和社会经济地位。我们对多种开源 LLM 进行评估发现,所有模型都呈现出一定程度的刻板偏见,其中与残疾相关的偏见尤为持久,而宗教偏见则较低,这可能是由于全球范围的去偏见努力所致。这表明需要更公平的模型开发。

关键词

引用

@article{arxiv.2510.02742,
  title  = {IndiCASA: A Dataset and Bias Evaluation Framework in LLMs Using Contrastive Embedding Similarity in the Indian Context},
  author = {Santhosh G S and Akshay Govind S and Gokul S Krishnan and Balaraman Ravindran and Sriraam Natarajan},
  journal= {arXiv preprint arXiv:2510.02742},
  year   = {2025}
}

备注

Accepted at 8th AAAI/ACM Conference on AI, Ethics, and Society (AIES) 2025