链条中的最弱环链:高级推理模型的安全漏洞
人工智能
2025-06-17 v1 密码学与安全
机器学习
摘要
高级推理能力的引入提升了大型语言模型在数学和编码基准任务中的表现,但这些推理模型相较非推理模型是否更易受对抗性提示攻击仍不明确。本文系统评估了具备高级推理模型相较相似非推理模型在多样化提示攻击类别中的弱点。通过实验数据,我们发现与非推理模型相比,增强推理的模型在平均攻击成功率上更稳健(42.51% vs 45.53%,数值越低越好)。然而,这一总体趋势掩盖了显著的类别性差异:对于某些攻击类型,推理模型更易受攻击(例如在树状攻击提示下差距最高达32个百分点),而对于其他类型则显著更稳健(例如在跨站脚本注入攻击中优势达29.8个百分点)。我们的发现凸显了高级推理在语言模型中的细致安全影响,强调在多样化对抗技术下进行压力测试对安全的重要性。
引用
@article{arxiv.2506.13726,
title = {Weakest Link in the Chain: Security Vulnerabilities in Advanced Reasoning Models},
author = {Arjun Krishna and Aaditya Rastogi and Erick Galinkin},
journal= {arXiv preprint arXiv:2506.13726},
year = {2025}
}
备注
Accepted to LLMSEC 2025