PrompTrend:面向大型语言模型的持续社区驱动漏洞发现与评估
密码学与安全
2025-07-28 v1 人工智能
摘要
静态基准测试无法捕捉在线论坛中通过社区实验涌现的 LLM 漏洞。我们提出了 PrompTrend,这是一个跨平台收集漏洞数据并使用多维评分对其进行评估的系统,其架构专为可扩展监控而设计。对在五个月期间(2025 年 1 月至 5 月)从在线社区收集并在九个商业模型上测试的 198 个漏洞的横截面分析表明,高级能力与某些架构中漏洞的增加相关,心理攻击显著优于技术利用,且平台动态以可测量的特定模型模式影响攻击有效性。PrompTrend 漏洞评估框架实现了 78% 的分类准确率,同时揭示了有限的跨模型可迁移性,这表明有效的 LLM 安全性需要超越传统周期性评估的全面社会技术监控。我们的发现挑战了能力提升会改善安全性的假设,并将社区驱动的心理操纵确立为当前语言模型的主导威胁向量。
引用
@article{arxiv.2507.19185,
title = {PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models},
author = {Tarek Gasmi and Ramzi Guesmi and Mootez Aloui and Jihene Bennaceur},
journal= {arXiv preprint arXiv:2507.19185},
year = {2025}
}