对抗性道德压力测试 大语言模型
人工智能
2026-04-02 v1
摘要
评估部署在软件系统中的大语言模型(LLM)的伦理鲁棒性仍然具有挑战性,尤其是在持续的对抗性用户交互情况下。现有的安全基准通常依赖于单轮评估和聚合指标,如毒性得分和拒绝率,这些指标对可能在现实多轮交互中出现的行为不稳定性提供了有限的可见性。因此,稀有的但高影响力的伦理失效以及渐进式的性能衰减效应可能在部署前未被检测到。本文引入对抗性道德压力测试(Adversarial Moral Stress Testing, AMST),这是一种用于评估在对抗性多轮交互下伦理鲁棒性的压力测试框架。AMST 对提示词应用结构化压力转换,并通过分布感知鲁棒性指标评估模型行为,这些指标捕捉跨交互轮次的方差、尾部风险和时间行为漂移。我们在包括 LLaMA-3-8B、GPT-4o 和 DeepSeek-v3 等多个最新 LLM 上,使用大量在受控压力条件下生成的对抗情景评估了 AMST。结果显示,不同模型之间存在显著的鲁棒性差异,揭示了在传统单轮评估协议下难以观察到的性能衰减模式。特别是,鲁棒性表现出对分布稳定性和尾部行为的依赖,而不仅仅是平均性能。此外,AMST 提供了一种可扩展且与模型无关的压力测试方法,使其能够为在对抗环境中运行的 LLM 驱动软件系统提供鲁棒性感知的评估和监控。
引用
@article{arxiv.2604.01108,
title = {Adversarial Moral Stress Testing of Large Language Models},
author = {Saeid Jamshidi and Foutse Khomh and Arghavan Moradi Dakhel and Amin Nikanjam and Mohammad Hamdaqa and Kawser Wazed Nafi},
journal= {arXiv preprint arXiv:2604.01108},
year = {2026}
}