中文

CALYREX:用于系统提示锚定的交叉注意力层扩展 Transformer

机器学习 2026-05-12 v1

摘要

现代大型语言模型(LLMs)依赖系统提示来建立行为约束和安全规则。标准的因果自注意力以同等的结构优先级对待特权指令和不受信任的用户内容——这种不匹配使得模型在长上下文中容易受到提示注入和指令侵蚀的影响。我们提出了 CALYREX(Cross-Attention LaYeR EXtended transformers),它利用输入与系统提示之间的交叉注意力来从结构上隔离并锚定规则。在 1.5B 主干网络上的放置消融实验确定,在最后八分之一层处插入是最佳的,这一点也得到了机制激活分析的证实,表明行为约束自然集中于此。在 8B 规模下,控制训练数据、主干网络和参数预算,CALYREX 在指令遵循(IFEval)上提升了 +7.4%+7.4\%,在多轮指令遵守上提升了 +16.3%+16.3\%,同时将多样本越狱攻击成功率降低了 13%13\%。这一优势似乎随模型规模扩大而增加,这与更大模型能更有效地利用专用路由路径相一致。

关键词

引用

@article{arxiv.2605.09737,
  title  = {CALYREX: Cross-Attention LaYeR EXtended Transformers for System Prompt Anchoring},
  author = {Li Lixing},
  journal= {arXiv preprint arXiv:2605.09737},
  year   = {2026}
}

备注

Preprint. 25 pages, 4 figures, 9 tables