中文

细微偏差需要更细微的度量:评估大型语言模型中代表性偏差和亲和性偏差的双重指标

计算与语言 2024-06-04 v4 人工智能 计算机与社会 机器学习

摘要

对大型语言模型(LLMs)的研究常常忽略了细微的偏差,这些偏差虽然不那么明显,但可能显著影响模型输出朝向特定的社会叙事。本研究针对LLMs中的两种此类偏差:代表性偏差(指LLMs倾向于生成反映某些身份群体经验的输出)和亲和性偏差(反映模型对特定叙事或观点的评估偏好)。我们引入了两个新指标来衡量这些偏差:代表性偏差分数(RBS)和亲和性偏差分数(ABS),并提出了创意导向生成套件(CoGS),这是一组开放式任务(如短篇故事写作和诗歌创作),设计了定制化的评分标准来检测这些细微偏差。我们的分析揭示了著名LLMs中存在显著的代表性偏差,偏好与白人、异性恋和男性相关的身份。此外,我们对亲和性偏差的调查揭示了每个模型内独特的评估模式,类似于“偏差指纹”。这种趋势在人类评估者中也能看到,突显了人类和机器偏差感知之间的复杂相互作用。

关键词

引用

@article{arxiv.2405.14555,
  title  = {Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models},
  author = {Abhishek Kumar and Sarfaroz Yunusov and Ali Emami},
  journal= {arXiv preprint arXiv:2405.14555},
  year   = {2024}
}

备注

9 pages (excluding references), accepted to ACL 2024 Main Conference