中文

SOMBRERO:衡量与引导端到端层次序列模型中的边界放置

机器学习 2026-02-02 v1 人工智能 计算与语言

摘要

层次序列模型用学习得到的分段代替固定分词,将长字节序列压缩以实现高效的自回归建模。虽然最近的端到端方法可仅凭语言模型目标学习得到有意义的边界,但要定量评估并系统性地引导计算花费的投入位置仍然困难。我们提出一种与路由无关的边界质量度量——边界丰富(boundary enrichment B),其衡量块起始位置对高后字节惊喜位置的集中程度。基于该度量,我们提出 Sombrero,通过置信对齐边界损失将边界引导至预测难度较高的位置,并通过在输入层面应用置信加权平滑来稳定边界学习。在 10 亿规模的 UTF-8 语料库(覆盖英文、德文、代码及数学内容)上,Sombrero 改善了准确率与效率之间的权衡,使边界更一致地将计算资源分配给难以预测的位置。

关键词

引用

@article{arxiv.2601.22805,
  title  = {SOMBRERO: Measuring and Steering Boundary Placement in End-to-End Hierarchical Sequence Models},
  author = {Pit Neitemeier and Alessio Serra and Jiaze Li and Sascha Wirges and Lukas Balles and Jan Hendrik Metzen},
  journal= {arXiv preprint arXiv:2601.22805},
  year   = {2026}
}