中文

HoloByte:用于无标记建模的连续球面蒸馏

机器学习 2026-03-19 v1

摘要

序列建模普遍依赖离散子词标记化,以规避原生字节级注意力的 O(N2)\mathcal{O}(N^2) 计算不可行性。然而,这种启发式量化施加人工形态边界,强制词汇依赖性,以及破坏优化 landscape 的连续性。为解决这一二元对立,本文引入 \textbf{HoloByte}:一个严格无标记化的框架,利用连续球面蒸馏。HoloByte 将离散字节序列划分为固定容量的块,并通过一种可逆、保持维度的正交旋转算子将其映射到连续严格受限的球面流形上。这种空间叠加允许一个巨型transformer仅 operate on 压缩后的连续表示,形式上将注意力时间复杂性从 O(N2D)\mathcal{O}(N^2D) 降低到 O(N2W2D+ND2)\mathcal{O}\left( \frac{N^2}{W^2}D + ND^2 \right)。随后,一个局部因果 micro-decoder 解绑这些表示以计算确切的字节级分布。为控制这种连续轨迹,我们提出一种双目标公式,包含数学精确的 Holographic 潜在均方误差,该误差严格限制梯度并保证渐近稳定性。理论上,我们推导实现从连续流形到离散恢复的最小嵌入维数 D=Ω(WlnV)D = \Omega(W \ln |\mathcal{V}|)。实证上,在严格匹配的参数约束下,HoloByte 系统性地优于相当的离散字节对编码(BPE)基线。这些结果确立了连续球面蒸馏作为面向词汇无关序列建模的数学严谨且计算可行的基础。代码可在 https://github.com/VladimerKhasia/HoloByte 查阅。

关键词

引用

@article{arxiv.2603.16917,
  title  = {HoloByte: Continuous Hyperspherical Distillation for Tokenizer-Free Modeling},
  author = {Vladimer Khasia},
  journal= {arXiv preprint arXiv:2603.16917},
  year   = {2026}
}