面向解码器-only大语言模型的检查点兼容语法注入的门控树交叉注意力
计算与语言
2026-04-28 v2
摘要
解码器-only大语言模型虽然在广泛任务上表现优异,但对微小的语法扰动极其脆弱,这削弱了其在下游推理中的可靠性。然而,直接将显式语法结构注入到现有检查点中,可能会干扰其预训练能力。我们引入一种检查点兼容的门控树交叉注意力(GTCA)分支,读取预计算的句法块记忆,同时保持 backbone 架构不变。我们的设计使用令牌更新掩码和分阶段训练,以控制结构更新的范围和时机。在各种基准测试和Transformer backbone 上,GTCA在不损害多选问答性能或常识推理的前提下,显著提升了语法鲁棒性,提供了一种实用的检查点兼容路径,使解码器-only LLM更具语法鲁棒性。
关键词
引用
@article{arxiv.2602.15846,
title = {Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs},
author = {Xinyu Gao and Shaonan Wang and Nai Ding},
journal= {arXiv preprint arXiv:2602.15846},
year = {2026}
}
备注
ACL 2026 MainConference