中文

微振动启发的探针:位置编码扰动揭示LLM异常行为

机器学习 2025-10-03 v1 人工智能

摘要

我们借鉴微振动——微小的不随意眼动——来揭示人类感知隐藏动态的 method,提出一种类似的探针方法用于大型语言模型(LLM)。正如微振动暴露视觉中细微但有信息量的变化,我们展示,轻量级的位置编码扰动可诱发指示模型异常行为的潜在信号。该方法无需微调或任务特定的监督,却能在事实性、安全性、毒性和后门攻击等多种情境中检测到 failure。针对多个最先进的 LLM 进行实验,表明这些基于扰动的探针在发现异常行为方面有效且计算高效。这些发现表明,预训练的 LLM 已经编码了标记自身 failure 证据的内部信息,微振动启发的干预为检测和缓解不良行为提供了一条路径。

关键词

引用

@article{arxiv.2510.01288,
  title  = {Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours},
  author = {Rui Melo and Rui Abreu and Corina S. Pasareanu},
  journal= {arXiv preprint arXiv:2510.01288},
  year   = {2025}
}

备注

9 main pages, 13 appendix pages