中文

探索大语言模型社会偏见评估中的主观性以实现更以人为中心的评估

人机交互 2024-05-21 v1

摘要

评估大型语言模型 (LLM) 的关键方面之一是识别其潜在偏见。这尤其重要,因为已有大量证据表明 LLM 可能在其文本输出中复制人类社会偏见,并进而影响利益相关者, potentially 放大对已被边缘化个体和社区的伤害。因此,近期的偏见检测努力投入于自动化基准和客观指标,如准确率 (即将 LLM 的输出与预定义的ground truth进行比较)。然而,社会偏见往往是细微的、主观的和情境依赖的,其中某种情况可能存在解释的可能性,且不存在ground truth。虽然这些情境对自动评估系统而言难以识别,但人类评估者可能能够捕捉到这些细微差别。在本文中,我们讨论了在识别 LLM 中的偏见时,利用人类评估和主观解释来增强自动化过程的作用,作为以人为中心的方法来评估这些模型。

关键词

引用

@article{arxiv.2405.11048,
  title  = {Exploring Subjectivity for more Human-Centric Assessment of Social Biases in Large Language Models},
  author = {Paula Akemi Aoyagui and Sharon Ferguson and Anastasia Kuzminykh},
  journal= {arXiv preprint arXiv:2405.11048},
  year   = {2024}
}

备注

HEAL Workshop at CHI Conference on Human Factors in Computing Systems, May 12, 2024, Honolulu, HI, USA