Computation and Language · Computer Science
MMTEB: Massive Multilingual Text Embedding Benchmark
Kenneth Enevoldsen, Isaac Chung, Imene Kerboua, Márton Kardos +82
2025-11-14
Computation and Language · Computer Science
Entropy-Driven Pre-Tokenization for Byte-Pair Encoding
Yifan Hu, Frank Liang, Dachuan Zhao, Jonathan Geuter +3
2025-06-23
Computation and Language · Computer Science
SuperBPE: Space Travel for Language Models
Alisa Liu, Jonathan Hayase, Valentin Hofmann, Sewoong Oh +2
2025-08-28
Computation and Language · Computer Science
Tokenization Is More Than Compression
Craig W. Schmidt, Varshini Reddy, Haoran Zhang, Alec Alameddine +3
2024-10-08
Computation and Language · Computer Science
Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models
Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly
2025-04-29
Computation and Language · Computer Science
MTEB: Massive Text Embedding Benchmark
Niklas Muennighoff, Nouamane Tazi, Loïc Magne, Nils Reimers
2023-03-21
Computation and Language · Computer Science
Char2Subword: Extending the Subword Embedding Space Using Robust Character Compositionality
Gustavo Aguilar, Bryan McCann, Tong Niu, Nazneen Rajani +2
2021-09-27
Computation and Language · Computer Science
LBPE: Long-token-first Tokenization to Improve Large Language Models
Haoran Lian, Yizhe Xiong, Zijia Lin, Jianwei Niu +4
2024-11-11
Computation and Language · Computer Science
Training Multilingual Pre-trained Language Model with Byte-level Subwords
Junqiu Wei, Qun Liu, Yinpeng Guo, Xin Jiang
2021-06-04
Computation and Language · Computer Science
Spanish Biomedical and Clinical Language Embeddings
Asier Gutiérrez-Fandiño, Jordi Armengol-Estapé, Casimiro Pio Carrino, Ona De Gibert +2
2021-02-26
Computation and Language · Computer Science
Don't Forget Cheap Training Signals Before Building Unsupervised Bilingual Word Embeddings
Silvia Severini, Viktor Hangya, Masoud Jalili Sabet, Alexander Fraser +1
2022-06-01
Computation and Language · Computer Science
ByteSpan: Information-Driven Subword Tokenisation
Zébulon Goriely, Suchir Salhan, Pietro Lesci, Julius Cheng +1
2025-06-24
Computation and Language · Computer Science
When Every Token Counts: Optimal Segmentation for Low-Resource Language Models
Bharath Raj, Garvit Suri, Vikrant Dewangan, Raghav Sonavane
2025-05-05