评估大型语言模型的主动风险意识
计算与语言
2026-02-25 v1 计算机与社会
摘要
随着大型语言模型(LLMs)越来越多地嵌入日常决策中,其安全责任不仅要超越对明确有害意图的反应,还要发展意识到意外但可能产生重大风险的能力。在本工作中,我们引入了一种主动风险意识评估框架,用于衡量 LLMs 是否能够预见潜在的伤害并在损害发生前提供警告。我们构建了 Butterfly 数据集,以环境和生态领域实例化此框架。该数据集包含 1,094 个查询,模拟普通求解活动,其响应可能引发潜在的生态影响。通过在五个广泛使用的 LLMs 上进行实验,我们分析了响应长度、语言和模态的影响。实验结果揭示,在长度受限的响应下,主动意识呈现一致的显著下降,跨语言之间存在相似性,并且在(多模态)物种保护方面存在持久的盲点。这些发现突显了当前安全对齐与实际生态责任要求之间的关键差距,强调在 LLM 部署中需要主动安全措施。
关键词
引用
@article{arxiv.2602.20976,
title = {Evaluating Proactive Risk Awareness of Large Language Models},
author = {Xuan Luo and Yubin Chen and Zhiyu Hou and Linpu Yu and Geng Tu and Jing Li and Ruifeng Xu},
journal= {arXiv preprint arXiv:2602.20976},
year = {2026}
}