交叉共情偏见与理解的定量评估
计算与语言
2024-11-15 v2 人工智能
人机交互
摘要
越来越多的文献批评当前对共情的操作性定义,这些定义基于对构念的松散界定。这种松散的定义损害了数据集质量、模型鲁棒性和评估可靠性。我们提出一个共情评估框架,该框架使共情的操作性定义接近其心理学起源。该框架使用现有的共情和情感效价指标来衡量LLM对提示词响应的变异性。这种变异性是通过控制提示词的生成引入的,即通过改变影响上下文理解的社会偏见,从而影响共情理解。对生成的控制确保了提示词数据集具有较高的理论效度。同时,它使得高质量翻译,尤其是翻译成目前几乎没有共情或偏见评估方法的语言(如斯拉夫语系),变得更加可行。我们使用选定的LLM和各种提示词类型,通过该框架演示了共情评估,包括多项选择答案和自由生成。我们初始评估样本中的变异性很小,无法测量出不同社会群体背景下共情理解的显著差异。但结果是令人鼓舞的,因为模型在推理链上表现出显著变化,以捕捉提示词中相对细微的变化。这为未来构建评估样本和统计方法的研究奠定了基础。
引用
@article{arxiv.2411.05777,
title = {Quantitative Assessment of Intersectional Empathetic Bias and Understanding},
author = {Vojtech Formanek and Ondrej Sotolar},
journal= {arXiv preprint arXiv:2411.05777},
year = {2024}
}