关于原子标记中编码的语义与句法信息及其在单步文本重建中的应用
机器学习
2026-02-23 v1 计算与语言
摘要
自回归大型语言模型(LLM)按令生成文本,需进行 n 次前向传播才能生成长度为 n 的序列。最近的工作《Exploring the Latent Capacity of LLMs for One-Step Text Reconstruction》(Mezentsev 和 Oseledets)表明,冻结的 LLM 可仅通过两个学习得到的原子标记(proto-tokens)在单次前向传播中重建数百个标记,这表明了超越自回归范式的可能性。在本文中,我们研究这些原子标记编码了什么信息以及在重建和受控约束下的行为特征。我们进行一系列实验,以解耦原子标记中的语义与句法内容,分析 e-token 的稳定性特征,并可视化在重建过程中对 e-token 的注意力模式。最后,我们测试了两种正则化方案,用于通过教师嵌入在 e-token 上“施加”语义结构,包括基于锚点的损失和关系蒸馏目标。我们的结果表明,在标准优化下,m-token 倾向于比 e-token 更强地捕获语义信息;基于锚点的约束与重建精度之间存在明显的权衡;而关系蒸馏能够在不牺牲重建质量的情况下,将批次级的语义关系传递到原子标记空间,支持未来基于预测作为中间表示的非自回归序列到序列系统的可行性。
引用
@article{arxiv.2602.18301,
title = {On the Semantic and Syntactic Information Encoded in Proto-Tokens for One-Step Text Reconstruction},
author = {Ivan Bondarenko and Egor Palkin and Fedor Tikunov},
journal= {arXiv preprint arXiv:2602.18301},
year = {2026}
}