Computation and Language · Computer Science
A Vocabulary-Free Multilingual Neural Tokenizer for End-to-End Task Learning
Md Mofijul Islam, Gustavo Aguilar, Pragaash Ponnusamy, Clint Solomon Mathialagan +2
2022-04-25
Computation and Language · Computer Science
Semantic Tokenizer for Enhanced Natural Language Processing
Sandeep Mehta, Darpan Shah, Ravindra Kulkarni, Cornelia Caragea
2023-04-26
Computation and Language · Computer Science
BPE Gets Picky: Efficient Vocabulary Refinement During Tokenizer Training
Pavel Chizhov, Catherine Arnett, Elizaveta Korotkova, Ivan P. Yamshchikov
2024-09-10
Computation and Language · Computer Science
Causal Estimation of Tokenisation Bias
Pietro Lesci, Clara Meister, Thomas Hofmann, Andreas Vlachos +1
2025-06-04
Computation and Language · Computer Science
Learn Your Tokens: Word-Pooled Tokenization for Language Modeling
Avijit Thawani, Saurabh Ghanekar, Xiaoyuan Zhu, Jay Pujara
2023-10-19
Computation and Language · Computer Science
Stop Taking Tokenizers for Granted: They Are Core Design Decisions in Large Language Models
Sawsan Alqahtani, Mir Tafseer Nayeem, Md Tahmid Rahman Laskar, Tasnim Mohiuddin +1
2026-01-27
Computation and Language · Computer Science
Tokenization Is More Than Compression
Craig W. Schmidt, Varshini Reddy, Haoran Zhang, Alec Alameddine +3
2024-10-08
Computation and Language · Computer Science
Comparative analysis of subword tokenization approaches for Indian languages
Sudhansu Bala Das, Samujjal Choudhury, Tapas Kumar Mishra, Bidyut Kr. Patra
2025-05-23
Computation and Language · Computer Science
Teaching Old Tokenizers New Words: Efficient Tokenizer Adaptation for Pre-trained Models
Taido Purason, Pavel Chizhov, Ivan P. Yamshchikov, Mark Fishel
2026-03-24
Computation and Language · Computer Science
Unpacking Tokenization: Evaluating Text Compression and its Correlation with Model Performance
Omer Goldman, Avi Caciularu, Matan Eyal, Kris Cao +2
2024-06-25
Computation and Language · Computer Science
Overcoming Vocabulary Constraints with Pixel-level Fallback
Jonas F. Lotz, Hendra Setiawan, Stephan Peitz, Yova Kementchedjhieva
2025-08-12
Computation and Language · Computer Science
Broken Tokens? Your Language Model can Secretly Handle Non-Canonical Tokenizations
Brian Siyuan Zheng, Alisa Liu, Orevaoghene Ahia, Jonathan Hayase +2
2026-02-04
Computation and Language · Computer Science
Lossless Vocabulary Reduction for Auto-Regressive Language Models
Daiki Chijiwa, Taku Hasegawa, Kyosuke Nishida, Shin'ya Yamaguchi +3
2026-02-19
Computation and Language · Computer Science
Vocabulary Customization for Efficient Domain-Specific LLM Deployment
Christian Herold, Michael Kozielski, Nicholas Santavas, Yannick Versley +1
2025-10-01
Computation and Language · Computer Science
ByteSpan: Information-Driven Subword Tokenisation
Zébulon Goriely, Suchir Salhan, Pietro Lesci, Julius Cheng +1
2025-06-24
Computation and Language · Computer Science
T-FREE: Subword Tokenizer-Free Generative LLMs via Sparse Representations for Memory-Efficient Embeddings
Björn Deiseroth, Manuel Brack, Patrick Schramowski, Kristian Kersting +1
2025-01-08
Computation and Language · Computer Science
Beyond Text Compression: Evaluating Tokenizers Across Scales
Jonas F. Lotz, António V. Lopes, Stephan Peitz, Hendra Setiawan +1
2025-06-04
Computation and Language · Computer Science
Dictionaries to the Rescue: Cross-Lingual Vocabulary Transfer for Low-Resource Languages Using Bilingual Dictionaries
Haruki Sakajo, Yusuke Ide, Justin Vasselli, Yusuke Sakai +3
2025-06-03