Swiss-Bench 003:评估瑞士监管背景下大语言模型的可靠性与对抗安全性
密码学与安全
2026-04-08 v1 人工智能
计算与语言
摘要
大语言模型(LLMs)在瑞士金融和监管环境中的部署需要生产可靠性和对抗安全性方面的经验证据,而这两个维度在现有的瑞士专注评估框架中尚未联合操作化。本文介绍了 Swiss-Bench 003(SBP-003),通过添加 D7(自评分可靠性代理)和 D8(对抗安全性),将 HAAS(瑞士人工智能评估分数)从六个维度扩展到八个维度。我们使用四种语言(德语、法语、意大利语、英语)评估了十个前沿模型,涵盖 808 个瑞士特定项目,包括七个瑞士适配基准(Swiss TruthfulQA、Swiss IFEval、Swiss SimpleQA、Swiss NIAH、Swiss PII-Scope、System Prompt Leakage 和 Swiss German Comprehension),针对 FINMA 指南 08/2024、修订后的联邦数据保护法(nDSG)和 OWASP LLM 十大漏洞。自评分 D7 分数(73-94%)远超外部评判的 D8 安全分数(20-61%),尽管这些维度使用不可比较的评分体系。系统提示泄露抗性范围为 24.8% 至 88.2%,而 PII 提取防御在所有模型中均较弱(14-42%)。Qwen 3.5 Plus 取得了最高的自评分 D7 分数(94.4%),而 GPT-oss 120B 取得了最高的 D8 分数(60.7%),尽管它是评估中成本最低的模型。所有评估均在提供者默认设置下以零样本方式进行;D7 是自评分的,不构成独立验证的准确性。我们提供了将基准维度与 FINMA 模型验证要求、nDSG 数据保护义务和 OWASP LLM 风险类别相关联的概念映射表。
引用
@article{arxiv.2604.05872,
title = {Swiss-Bench 003: Evaluating LLM Reliability and Adversarial Security for Swiss Regulatory Contexts},
author = {Fatih Uenal},
journal= {arXiv preprint arXiv:2604.05872},
year = {2026}
}
备注
23 pages, 5 figures, 8 tables