中文

未来安全,过去危险:剖析大语言模型中的时间与语言脆弱性

计算与语言 2026-01-09 v2 人工智能 计算机与社会

摘要

随着大语言模型(LLM)融入全球关键基础设施,安全对齐从英语零样本迁移到其他语言的假设仍然是一个危险的盲点。本研究使用HausaSafety(一个基于西非威胁场景(例如,雅虎雅虎欺诈、丹麦枪制造)的新型对抗性数据集)对三个最先进的模型(GPT-5.1、Gemini 3 Pro和Claude 4.5 Opus)进行了系统性审计。我们采用2x4析因设计,在1440次评估中测试了语言(英语与豪萨语)和时间框架之间的非线性交互作用。我们的结果挑战了多语言安全差距的叙事。我们并未在低资源环境中观察到简单的性能退化,而是发现了一种复杂的干扰机制,其中安全性由变量的交集决定。尽管模型表现出反向语言脆弱性,Claude 4.5 Opus在豪萨语中(45.0%)被证明比在英语中(36.7%)显著更安全,这归因于不确定性驱动的拒绝回答,但它们在时间推理方面遭受了灾难性失败。我们报告了一种深刻的时间不对称性,其中过去时框架绕过了防御(15.6%安全),而将来时场景则触发了过度保守的拒绝(57.2%安全)。这种波动性的程度通过最安全和最脆弱配置之间9.2倍的差异得以说明,证明了安全性不是一个固定属性,而是一个依赖于上下文的状态。我们得出结论,当前模型依赖于表面的启发式方法,而非稳健的语义理解,从而创造了“安全口袋”,使全球南方用户暴露于本地化的危害之中。我们提出不变对齐作为必要的范式转变,以确保跨语言和时间变化的安全性稳定性。

关键词

引用

@article{arxiv.2512.24556,
  title  = {Safe in the Future, Dangerous in the Past: Dissecting Temporal and Linguistic Vulnerabilities in LLMs},
  author = {Muhammad Abdullahi Said and Muhammad Sammani Sani},
  journal= {arXiv preprint arXiv:2512.24556},
  year   = {2026}
}