CORVUS:通过大语言模型内部信号伪装进行 hallucination 检测器的红队攻击
密码学与安全
2026-01-22 v1 人工智能
摘要
单次 pass 的 hallucination 检测器依赖于大语言模型的内部遥测信号(如不确定性、隐藏状态几何和注意力),隐式地假设 hallucination 在这些信号中留下可分离的痕迹。我们研究了一种白盒、模型侧的对手,该对手在保持检测器固定的情况下,对模型进行轻量级 LoRA adapter 的微调,引入 CORVUS,这是一个高效的红队程序,通过教师强制学习来伪装检测器可见的遥测信号,包括一种嵌入空间 FGSM 注意力压力测试。在 1000 条零分布 Alpaca 指令上训练(<0.5% 可训练参数),CORVUS 可迁移至 Llama-2、Vicuna、Llama-3 和 Qwen2.5 上的 FAVA-Annotation,并降解了训练免费检测器(如 LLM-Check)和探针式检测器(如 SEP、ICR-probe),促使采用外部 grounding 或跨模型证据进行对抗感知审计。
引用
@article{arxiv.2601.14310,
title = {CORVUS: Red-Teaming Hallucination Detectors via Internal Signal Camouflage in Large Language Models},
author = {Nay Myat Min and Long H. Pham and Hongyu Zhang and Jun Sun},
journal= {arXiv preprint arXiv:2601.14310},
year = {2026}
}
备注
13 pages, 1 figure