中文

社会人口学提示尚非用 LLM 模拟主观判断的有效方法

计算与语言 2025-02-18 v2 人工智能 计算机与社会 人机交互 机器学习

摘要

人类判断 inherently 具有主观性,并受到性别与族裔等个人特质的主动影响。尽管大语言模型(LLM)被广泛用于在各种情境中模拟人类反应,其在主观任务中考虑人口统计学差异的能力仍不确定。在本研究中,利用 POPQUORN 数据集,我们评估了九种流行 LLM 在理解两种主观判断任务(礼貌性与冒犯性)中人口统计学差异的能力。我们发现,在零样本设置下,多数模型对两项任务的预测更贴近白人参与者的标注,而非亚裔或黑人参与者;仅在礼貌性任务中出现轻微偏向女性的性别偏差。此外,社会人口学提示并未一致地改善、且在某些情况下恶化了 LLM 感知特定子群体语言的能力。这些发现凸显了 LLM 在执行主观判断任务时的潜在人口统计学偏差,并强调了社会人口学提示作为实现多元对齐策略的局限性。代码与数据见:https://github.com/Jiaxin-Pei/LLM-as-Subjective-Judge。

关键词

引用

@article{arxiv.2311.09730,
  title  = {Sociodemographic Prompting is Not Yet an Effective Approach for Simulating Subjective Judgments with LLMs},
  author = {Huaman Sun and Jiaxin Pei and Minje Choi and David Jurgens},
  journal= {arXiv preprint arXiv:2311.09730},
  year   = {2025}
}