中文

Zonkey:一种具有可微分标记化和概率注意力的层次扩散语言模型

计算与语言 2026-01-30 v1

摘要

大型语言模型 (LLM) 已彻底改变自然语言处理领域,但仍受限于固定且不可微分的标记化器,如字节对编码 (BPE),这阻碍了端到端优化和对噪声或特定领域数据的适应性。我们引入 Zonkey,这是一个层次扩散模型,旨在解决上述限制,通过完全可训练的从原始字符到文档级表示的管道。其核心是一种可微分标记化器 (Segment Splitter),它学习概率性的开始序列 (BOS) 决策,实现适应性分割,无需显式监督即可涌现出具有语言学意义的分割(例如,在空格处识别词边界,在句点处识别句子开头)。这种可微分性得益于我们 novel 的概率注意力机制,它包含位置特定的存在概率,以模拟对理论上无限序列的软掩码,同时保持梯度。序列以概率方式衰减,而非依赖终止序列标记,支持可变长度输出。层次级别将序列压缩为更高抽象(例如,将字符 n-gram 压缩为类词向量,然后压缩为类句向量),通过我们提出的去噪扩散混合模型 (DDMM) 实现重建,以实现潜在空间中稳定且高效的去噪。Stitcher 确保跨段落的重叠不变性。在 Wikipedia 上进行端到端训练后,Zonkey 能够从噪声生成连贯且可变长度的文本,展现出涌现的层次结构,并与基于熵的可学习标记化器相比在数据分布上的定性对齐方面表现有希望。我们的做法朝着完全基于梯度的 LLM 迈进,潜力在于更好的领域适应和可扩展生成。我们发布了用于训练和复现实验的源代码。

关键词

引用

@article{arxiv.2601.21768,
  title  = {Zonkey: A Hierarchical Diffusion Language Model with Differentiable Tokenization and Probabilistic Attention},
  author = {Alon Rozental},
  journal= {arXiv preprint arXiv:2601.21768},
  year   = {2026}
}