中文

大型语言模型是否反映安全领域的人口学多样性?

计算与语言 2026-02-10 v1

摘要

大型语言模型(LLM)的安全性本质上是多元化的,反映了道德规范、文化期望和人口学背景的差异。然而,现有的对齐数据集如 ANTHROPIC-HH 和 DICES 依赖于人口学范围狭窄的标注者池,忽略了不同社区对安全感知的差异。Demo-SafetyBench 通过在提示层面建模人口学多样性,实现价值框架与响应的解耦。在阶段 I 中,我们使用 Mistral 7B-Instruct-v0.3 将 DICES 中的提示重新分类为 14 个安全领域(改自 BEAVERTAILS),保留人口学元数据,并通过 Llama-3.1-8B-Instruct 结合 SimHash 去重扩展低资源领域,得到 43,050 个样本。在阶段 II 中,我们使用 LLMs-as-Raters-Gemma-7B、GPT-4o 和 LLaMA-2-7B 进行零样本推理评估多样性敏感性。平衡阈值(delta = 0.5, tau = 10)实现了高可靠性(ICC = 0.87)和低人口学敏感性(DS = 0.12),证明多样性安全评估既可扩展又具人口学鲁棒性。

关键词

引用

@article{arxiv.2602.07376,
  title  = {Do Large Language Models Reflect Demographic Pluralism in Safety?},
  author = {Usman Naseem and Gautam Siddharth Kashyap and Sushant Kumar Ray and Rafiq Ali and Ebad Shabbir and Abdullah Mohammad},
  journal= {arXiv preprint arXiv:2602.07376},
  year   = {2026}
}

备注

Accepted at EACL Findings 2026