大型语言模型是否反映安全领域的人口学多样性?
计算与语言
2026-02-10 v1
摘要
大型语言模型(LLM)的安全性本质上是多元化的,反映了道德规范、文化期望和人口学背景的差异。然而,现有的对齐数据集如 ANTHROPIC-HH 和 DICES 依赖于人口学范围狭窄的标注者池,忽略了不同社区对安全感知的差异。Demo-SafetyBench 通过在提示层面建模人口学多样性,实现价值框架与响应的解耦。在阶段 I 中,我们使用 Mistral 7B-Instruct-v0.3 将 DICES 中的提示重新分类为 14 个安全领域(改自 BEAVERTAILS),保留人口学元数据,并通过 Llama-3.1-8B-Instruct 结合 SimHash 去重扩展低资源领域,得到 43,050 个样本。在阶段 II 中,我们使用 LLMs-as-Raters-Gemma-7B、GPT-4o 和 LLaMA-2-7B 进行零样本推理评估多样性敏感性。平衡阈值(delta = 0.5, tau = 10)实现了高可靠性(ICC = 0.87)和低人口学敏感性(DS = 0.12),证明多样性安全评估既可扩展又具人口学鲁棒性。
引用
@article{arxiv.2602.07376,
title = {Do Large Language Models Reflect Demographic Pluralism in Safety?},
author = {Usman Naseem and Gautam Siddharth Kashyap and Sushant Kumar Ray and Rafiq Ali and Ebad Shabbir and Abdullah Mohammad},
journal= {arXiv preprint arXiv:2602.07376},
year = {2026}
}
备注
Accepted at EACL Findings 2026