中文

STAR:通过状态转移放大比检测 LLM 推理中的推理时后门

计算与语言 2026-01-14 v1 密码学与安全 机器学习

摘要

近期的 LLM 越来越多地集成了思维链等推理机制。然而,这种显式推理为推理时后门暴露了新的攻击面,这些后门在不改变模型参数的情况下注入恶意推理路径。由于这些攻击生成语言连贯的路径,它们能有效规避传统检测。为了解决这个问题,我们提出了 STAR(State-Transition Amplification Ratio),一个通过分析输出概率偏移来检测后门的框架。STAR 利用了一种统计差异:由恶意输入诱导的路径在模型的通用知识中尽管先验概率较低,却表现出较高的后验概率。我们量化了这种状态转移放大,并采用 CUSUM 算法来检测持续异常。在多种模型(8B-70B)和五个基准数据集上的实验表明,STAR 表现出强大的泛化能力,始终达到近乎完美的性能(AUROC \approx 1.0),且效率比现有基线高约 42×42\times。此外,该框架对试图绕过检测的自适应攻击也表现出鲁棒性。

关键词

引用

@article{arxiv.2601.08511,
  title  = {STAR: Detecting Inference-time Backdoors in LLM Reasoning via State-Transition Amplification Ratio},
  author = {Seong-Gyu Park and Sohee Park and Jisu Lee and Hyunsik Na and Daeseon Choi},
  journal= {arXiv preprint arXiv:2601.08511},
  year   = {2026}
}

备注

16 pages, 5 figures