序列重复增强标记嵌入并提升仅解码器模型的序列标注
计算与语言
2026-01-27 v1
摘要
现代语言模型(LM)以自回归方式训练,仅以前缀为条件。相比之下,序列标注(SL)任务为每个输入标记分配标签,自然受益于双向上下文。这一差异长期以来导致 SL 依赖于内在双向编码器模型。然而,仅解码器模型的快速发展引发了一个问题:它们能否适应 SL。虽然移除因果掩码已被证明是一种可行的技术,用于适应仅解码器模型以利用完整上下文进行 SL,但该方法需要对基础模型功能进行大量修改。本工作探索序列重复(SR)作为一种更不侵入性的替代方案,用于在仅解码器模型中实现双向性。通过微调实验,我们表明 SR 本质上会使解码器双向化,提高标记级别嵌入的质量,并超越编码器和未屏蔽解码器。与早期的说法相反,我们发现增加重复次数并不会降低 SL 性能。最后,我们展示了来自中间层的嵌入在 SR 中效果极佳,相当于来自最终层的嵌入,而计算效率显著更高。我们的发现凸显了 SR 缓解了解码器的结构性限制,使其更高效且更具可适应性,同时扩大了其适用于其他标记级任务的范围。
引用
@article{arxiv.2601.17585,
title = {Sequence Repetition Enhances Token Embeddings and Improves Sequence Labeling with Decoder-only Language Models},
author = {Matija Luka Kukić and Marko Čuljak and David Dukić and Martin Tutek and Jan Šnajder},
journal= {arXiv preprint arXiv:2601.17585},
year = {2026}
}
备注
Accepted at EACL 2026 Findings