中文

PrompTrend:面向大型语言模型的持续社区驱动漏洞发现与评估

密码学与安全 2025-07-28 v1 人工智能

摘要

静态基准测试无法捕捉在线论坛中通过社区实验涌现的 LLM 漏洞。我们提出了 PrompTrend,这是一个跨平台收集漏洞数据并使用多维评分对其进行评估的系统,其架构专为可扩展监控而设计。对在五个月期间(2025 年 1 月至 5 月)从在线社区收集并在九个商业模型上测试的 198 个漏洞的横截面分析表明,高级能力与某些架构中漏洞的增加相关,心理攻击显著优于技术利用,且平台动态以可测量的特定模型模式影响攻击有效性。PrompTrend 漏洞评估框架实现了 78% 的分类准确率,同时揭示了有限的跨模型可迁移性,这表明有效的 LLM 安全性需要超越传统周期性评估的全面社会技术监控。我们的发现挑战了能力提升会改善安全性的假设,并将社区驱动的心理操纵确立为当前语言模型的主导威胁向量。

关键词

引用

@article{arxiv.2507.19185,
  title  = {PrompTrend: Continuous Community-Driven Vulnerability Discovery and Assessment for Large Language Models},
  author = {Tarek Gasmi and Ramzi Guesmi and Mootez Aloui and Jihene Bennaceur},
  journal= {arXiv preprint arXiv:2507.19185},
  year   = {2025}
}