细微偏差需要更细微的度量:评估大型语言模型中代表性偏差和亲和性偏差的双重指标
计算与语言
2024-06-04 v4 人工智能
计算机与社会
机器学习
摘要
对大型语言模型(LLMs)的研究常常忽略了细微的偏差,这些偏差虽然不那么明显,但可能显著影响模型输出朝向特定的社会叙事。本研究针对LLMs中的两种此类偏差:代表性偏差(指LLMs倾向于生成反映某些身份群体经验的输出)和亲和性偏差(反映模型对特定叙事或观点的评估偏好)。我们引入了两个新指标来衡量这些偏差:代表性偏差分数(RBS)和亲和性偏差分数(ABS),并提出了创意导向生成套件(CoGS),这是一组开放式任务(如短篇故事写作和诗歌创作),设计了定制化的评分标准来检测这些细微偏差。我们的分析揭示了著名LLMs中存在显著的代表性偏差,偏好与白人、异性恋和男性相关的身份。此外,我们对亲和性偏差的调查揭示了每个模型内独特的评估模式,类似于“偏差指纹”。这种趋势在人类评估者中也能看到,突显了人类和机器偏差感知之间的复杂相互作用。
引用
@article{arxiv.2405.14555,
title = {Subtle Biases Need Subtler Measures: Dual Metrics for Evaluating Representative and Affinity Bias in Large Language Models},
author = {Abhishek Kumar and Sarfaroz Yunusov and Ali Emami},
journal= {arXiv preprint arXiv:2405.14555},
year = {2024}
}
备注
9 pages (excluding references), accepted to ACL 2024 Main Conference