CRiskEval:中文多维风险评估基准数据集
计算与语言
2024-06-10 v1
摘要
大语言模型(LLM)具备诸多有益能力,但其潜在倾向可能在未来转化为不可预测的风险。为此,我们提出CRiskEval——一个专为评估LLM风险倾向而设计的中文数据集,旨对资源获取、恶意协调等潜在风险进行预防性评估。为构建CRiskEval,我们定义了新的风险分类体系,包含7类前沿风险及4个安全等级,包括极危险、危险、中性及安全。我们遵循倾向性评估的原则,通过细粒度多选问答题来衡量LLM的表述性愿望。数据集由14,888个问题构成,模拟与预定义7类前沿风险相关的情景。每个问题配有4个答案选项,表述与问题相关的意见或行为倾向。所有答案选项均被手动标注为上述4个风险等级之一,从而可为每个评估的LLM构建细粒度的前沿风险轮廓。对CRiskEval进行的广泛评估揭示了令人震惊的发现:大多数模型在风险倾向上超过40%(加权倾向于4个风险等级)。此外,随着模型规模的增大,模型对紧急自我维持、权力争取等危险目标倾向的微妙增加趋势显而易见。为推动前沿风险评估领域的进一步研究,我们已公开发布数据集至https://github.com/lingshi6565/Risk_eval。
引用
@article{arxiv.2406.04752,
title = {CRiskEval: A Chinese Multi-Level Risk Evaluation Benchmark Dataset for Large Language Models},
author = {Ling Shi and Deyi Xiong},
journal= {arXiv preprint arXiv:2406.04752},
year = {2024}
}
备注
28 pages, 5 figures