中文

超越标记探针:基于 ACT-ViT 的激活张量 hallucination 检测

机器学习 2025-10-02 v1

摘要

检测 Large Language Model 生成文本中的 hallucination 对于其安全部署至关重要。虽然探针分类器显示出前景,但它们仅针对单独的图层-词对 operate,且仅适用于 LLM,限制了其有效性并阻碍了跨 LLM 的应用。在本文中,我们提出了一种新方法来解决这些短板。我们建立在激活数据在两个轴上(图层 ×\times 词)的自然序列结构之上,主张将完整的激活张量类比于图像。我们设计了 ACT-ViT,一种受 Vision Transformer 启发的模型,可有效且高效地应用于激活张量,并支持来自多个 LLM 的数据同时训练。通过涵盖多种 LLM 和数据集的全面实验,我们展示 ACT-ViT 在传统探针技术之上始终显著优于后者,同时保持极高的部署效率。特别是,我们表明该架构从多 LLM 训练中受益显著,能够在未见数据集上实现强大的零样性能,并可通过微调有效地迁移到新的 LLM。完整代码请参见 https://github.com/BarSGuy/ACT-ViT。

关键词

引用

@article{arxiv.2510.00296,
  title  = {Beyond Token Probes: Hallucination Detection via Activation Tensors with ACT-ViT},
  author = {Guy Bar-Shalom and Fabrizio Frasca and Yaniv Galron and Yftah Ziser and Haggai Maron},
  journal= {arXiv preprint arXiv:2510.00296},
  year   = {2025}
}

备注

Published in NeurIPS 2025