中文

揭示 LLM 中隐藏的暴力倾向:基于行为情境问卷的人口统计分析

计算与语言 2025-06-27 v1 人工智能

摘要

大语言模型(LLM)越来越多地被提出用于检测和响应网络上的暴力内容,然而它们对道德模糊的现实场景的推理能力仍有待考察。我们提出了首个使用经验证的社会科学工具——即暴力行为情境问卷(VBVQ)——来评估 LLM 的研究,该工具旨在衡量人类对日常冲突的反应。为了评估潜在偏差,我们引入了基于角色的提示,在美国范围内改变种族、年龄和地理身份。在统一的零样本设置下,评估了在不同地缘政治和组织背景下开发的六个 LLM。我们的研究揭示了两个关键发现:(1)LLM 表面层的文本生成通常与其内部对暴力响应的偏好相背离;(2)其暴力倾向因人口统计特征而异,且经常与犯罪学、社会科学和心理学中的既有发现相矛盾。

关键词

引用

@article{arxiv.2506.20822,
  title  = {Uncovering Hidden Violent Tendencies in LLMs: A Demographic Analysis via Behavioral Vignettes},
  author = {Quintin Myers and Yanjun Gao},
  journal= {arXiv preprint arXiv:2506.20822},
  year   = {2025}
}

备注

Under review