中文

看见文字:从分词到视觉阅读

计算机视觉与模式识别 2026-03-27 v2 计算与语言

摘要

人类看到文字。人类通过识别单词的视觉特征(包括形状、布局和图案),在将其与意义关联之前,就能有效处理拼写错误、变形字体和各种脚本。然而,现代大型语言模型(LLM)依赖子词分词,将文本碎片化为来自固定词汇表的片段。虽然对高资源语言有效,但这种方法会过度分割低资源语言,导致长且在语言学上毫无意义的序列,从而增加计算开销。本文挑战这一根深蒙固的范式,致力于视觉中心化的替代方案。我们的方法SeeTok将文本渲染为图像(视觉文本),并利用预训练的多模态LLM进行解释,复用了从大规模多模态训练中学习到的强大的OCR和文本-视觉对齐能力。在三个不同的语言任务中,SeeTok在匹配或超越子词分词器的同时,只需原来4.43倍的标记数,并将计算量(FLOPs)降低70.5%,在跨语言泛化、对拓扑噪声的鲁棒性和语言层次方面还获得额外收益。SeeTok标志着从符号化分词向类人视觉阅读的转变,为构建更自然且受认知启发的语言模型迈出了一步。

关键词

引用

@article{arxiv.2510.18840,
  title  = {See the Text: From Tokenization to Visual Reading},
  author = {Ling Xing and Rui Yan and Alex Jinpeng Wang and Zechao Li and Jinhui Tang},
  journal= {arXiv preprint arXiv:2510.18840},
  year   = {2026}
}