中文

面向解码器-only大语言模型的检查点兼容语法注入的门控树交叉注意力

计算与语言 2026-04-28 v2

摘要

解码器-only大语言模型虽然在广泛任务上表现优异,但对微小的语法扰动极其脆弱,这削弱了其在下游推理中的可靠性。然而,直接将显式语法结构注入到现有检查点中,可能会干扰其预训练能力。我们引入一种检查点兼容的门控树交叉注意力(GTCA)分支,读取预计算的句法块记忆,同时保持 backbone 架构不变。我们的设计使用令牌更新掩码和分阶段训练,以控制结构更新的范围和时机。在各种基准测试和Transformer backbone 上,GTCA在不损害多选问答性能或常识推理的前提下,显著提升了语法鲁棒性,提供了一种实用的检查点兼容路径,使解码器-only LLM更具语法鲁棒性。

关键词

引用

@article{arxiv.2602.15846,
  title  = {Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs},
  author = {Xinyu Gao and Shaonan Wang and Nai Ding},
  journal= {arXiv preprint arXiv:2602.15846},
  year   = {2026}
}

备注

ACL 2026 MainConference