中文

信任我,我知道这个函数:利用偏见劫持LLM静态分析

机器学习 2025-12-19 v2 密码学与安全

摘要

大型语言模型(LLMs)越来越被信赖用于大规模的自动化代码审查和静态分析,支持诸如漏洞检测、摘要生成和重构等任务。本文识别并利用了LLM基于代码分析中的一个关键漏洞:一种抽象偏差,导致模型对熟悉的编程模式进行过度概括,忽略小而有意义的错误。对手可以利用这一盲点,通过最小修改而不影响实际运行行为来劫持LLM对代码解释的控制流。我们将此类攻击称为熟悉模式攻击(Familiar Pattern Attack, FPA)。我们开发了一个完全自动化的黑盒算法,用于发现并注入目标代码中的FPA。我们的评估表明,FPA不仅对基础模型和推理模型有效,但且跨模型家族(OpenAI、Anthropic、Google)可移植,同时跨编程语言(Python、C、Rust、Go)通用。此外,FPA即使在模型通过鲁棒系统提示明确警告攻击时仍然有效。最后,我们探讨了FPA的积极、防御性用途,并讨论了其对面向代码的LLMs可靠性与安全性的更广泛影响。

关键词

引用

@article{arxiv.2508.17361,
  title  = {Trust Me, I Know This Function: Hijacking LLM Static Analysis using Bias},
  author = {Shir Bernstein and David Beste and Daniel Ayzenshteyn and Lea Schonherr and Yisroel Mirsky},
  journal= {arXiv preprint arXiv:2508.17361},
  year   = {2025}
}