微振动启发的探针:位置编码扰动揭示LLM异常行为
机器学习
2025-10-03 v1 人工智能
摘要
我们借鉴微振动——微小的不随意眼动——来揭示人类感知隐藏动态的 method,提出一种类似的探针方法用于大型语言模型(LLM)。正如微振动暴露视觉中细微但有信息量的变化,我们展示,轻量级的位置编码扰动可诱发指示模型异常行为的潜在信号。该方法无需微调或任务特定的监督,却能在事实性、安全性、毒性和后门攻击等多种情境中检测到 failure。针对多个最先进的 LLM 进行实验,表明这些基于扰动的探针在发现异常行为方面有效且计算高效。这些发现表明,预训练的 LLM 已经编码了标记自身 failure 证据的内部信息,微振动启发的干预为检测和缓解不良行为提供了一条路径。
引用
@article{arxiv.2510.01288,
title = {Microsaccade-Inspired Probing: Positional Encoding Perturbations Reveal LLM Misbehaviours},
author = {Rui Melo and Rui Abreu and Corina S. Pasareanu},
journal= {arXiv preprint arXiv:2510.01288},
year = {2025}
}
备注
9 main pages, 13 appendix pages