中文

基于多层 SAE 过渡实现域限制

人工智能 2026-05-13 v1

摘要

大型语言模型 (LLM) 的通用性质为特定领域应用带来了显著挑战,常导致 out-of-domain (OOD) 交互,削弱提供者的意图。现有方法将 LLM 视为不可解释的黑盒,忽略输入的内部处理。在本工作中,我们表明层次过渡为提取 domain-specific signature 提供了可行途径。具体而言,我们提出了几种轻量级的学习方式,利用稀疏自编码器 (SAE) 编码的内部动态,这些方法在区分 OOD 文本方面表现出极强能力。基于 SAEs 表示过渡使我们能够更好地解释 LLM 输入处理的内部演化,并为其决策提供理解。我们对该方法进行全面分析,并以 gemma-2 2B 和 9B 模型进行基准测试。我们的结果强调,内部过程在捕获输入相关细节方面具有较强的捕获能力。

关键词

引用

@article{arxiv.2605.11920,
  title  = {Domain Restriction via Multi SAE Layer Transitions},
  author = {Elias Shaheen and Avi Mendelson},
  journal= {arXiv preprint arXiv:2605.11920},
  year   = {2026}
}