中文

安全性对谁而言?——重新思考面向真实用户的 LLM 安全评估

人工智能 2026-04-21 v2 计算机与社会

摘要

大型语言模型(LLM)的安全评估通常聚焦于普遍风险,如危险能力或不良倾向。然而,数百万用户会就高风险主题(如金融和健康)的个人建议使用 LLM,其中伤害是情境相关的而非普遍的。虽然 OECD 的 AI 分类框架认识到评估个体风险的必要性,但针对用户福祉的安全评估仍不成熟。我们认为,由于存在关于如何在评估设计中纳入用户情境的根本性问题,开发此类评估并非易事。本 exploratory 研究在 GPT-5、Claude Sonnet 4 和 Gemini 2.5 Pro 等模型上,对金融和健康建议进行评估,涵盖不同易受伤害的用户档案。首先,我们展示评估者必须获取丰富的用户情境信息:相同的 LLM 回应被具备情境信息的评估者明显更安全地评估(安全得分从 5/7 下降至 3/7),而情境盲目评估者则给出更高的安全评分。一种可能的解决思路是创建包含关键情境信息的真实用户提示,但我们的第二项研究表明:即使使用用户报告会披露的情境,评估效果仍无显著提升。我们的工作表明,有效的用户福祉安全评估需要评估者针对多样化的用户档案进行评估,仅凭真实的用户情境披露不足以弥补差距,尤其对易受伤害人群而言。通过展示情境感知评估的方法,本研究为此类评估提供了起点,并提供了评估个体福祉所需方法与现有普遍风险框架差异的基础证据。我们发布代码和数据集以促进未来发展。

关键词

引用

@article{arxiv.2512.10687,
  title  = {Safe for Whom? Rethinking How We Evaluate the Safety of LLMs for Real Users},
  author = {Manon Kempermann and Sai Suresh Macharla Vasu and Mahalakshmi Raveenthiran and Theo Farrell and Ingmar Weber},
  journal= {arXiv preprint arXiv:2512.10687},
  year   = {2026}
}

备注

Paper accepted at IASEAI'26; please cite that peer-reviewed version instead