视觉渲染是否绕过分词?像素-based 语言模型中脚本-分词错位的调查
计算与语言
2026-02-10 v1 人工智能
机器学习
摘要
虽然像素-based 语言建模旨在通过将文本渲染为图像来绕过子词分词瓶颈,但近期的多模态变体如 DualGPT 却重新引入文本分词以提升自回归性能。我们调查了一个根本性问题:视觉渲染是否真的将模型从分词约束中解耦?聚焦于四种印尼低资源本地语言(即巴萨那文、乌加利斯文、巴兰斯文和兰库恩斯文),这些语言拥有独立的非拉丁文字码。我们评估了脚本-分词对齐在 DualGPT 架构中的影响。我们的结果表明,尽管进行了视觉渲染,但将文本分词重新集成到架构中仍会重新引入像素-based 语言建模旨在解决的同一问题,即分词错位问题。尽管具有更低的 OOV 和 fertility rate,我们展示了 Llama 2 分词器相较于自定义分词器表现显著更差,改进幅度可达最高 30.15 的 chrF++。我们的发现为未来的多模态变体提供警示,因为文本分词仍是实现公平模型的重要障碍。
关键词
引用
@article{arxiv.2602.06973,
title = {Does Visual Rendering Bypass Tokenization? Investigating Script-Tokenizer Misalignment in Pixel-Based Language Models},
author = {Lucky Susanto and Musa Izzanardi Wijanarko and Khumaisa Nur'aini and Farid Adilazuarda and Alham Fikri Aji and Derry Tanti Wijaya},
journal= {arXiv preprint arXiv:2602.06973},
year = {2026}
}
备注
Submitted to ARR January