Computation and Language · Computer Science
An Empirical Study of Tokenization Strategies for Various Korean NLP Tasks
Kyubyong Park, Joohong Lee, Seongbo Jang, Dawoon Jung
2020-10-07
Computation and Language · Computer Science
Improving Korean NLP Tasks with Linguistically Informed Subword Tokenization and Sub-character Decomposition
Taehee Jeon, Bongseok Yang, Changhwan Kim, Yoonseob Lim
2023-11-08
Computation and Language · Computer Science
Self-Vocabularizing Training for Neural Machine Translation
Pin-Jie Lin, Ernie Chang, Yangyang Shi, Vikas Chandra
2025-04-02
cmp-lg · Computer Science
Korean to English Translation Using Synchronous TAGs
Dania Egedi, Martha Palmer, Hyun S. Park, Aravind K. Joshi
2008-02-03
Computation and Language · Computer Science
Does Manipulating Tokenization Aid Cross-Lingual Transfer? A Study on POS Tagging for Non-Standardized Languages
Verena Blaschke, Hinrich Schütze, Barbara Plank
2023-04-21
Computation and Language · Computer Science
When Every Token Counts: Optimal Segmentation for Low-Resource Language Models
Bharath Raj, Garvit Suri, Vikrant Dewangan, Raghav Sonavane
2025-05-05
Computation and Language · Computer Science
Understanding and Mitigating Tokenization Bias in Language Models
Buu Phan, Marton Havasi, Matthew Muckley, Karen Ullrich
2024-07-09
Computation and Language · Computer Science
How does a Language-Specific Tokenizer affect LLMs?
Jean Seo, Jaeyoon Kim, SungJoo Byun, Hyopil Shin
2025-02-24
Computation and Language · Computer Science
Comparative analysis of subword tokenization approaches for Indian languages
Sudhansu Bala Das, Samujjal Choudhury, Tapas Kumar Mishra, Bidyut Kr. Patra
2025-05-23
Computation and Language · Computer Science
A Systematic Analysis of Vocabulary and BPE Settings for Optimal Fine-tuning of NMT: A Case Study of In-domain Translation
J. Pourmostafa Roshan Sharami, D. Shterionov, P. Spronck
2023-03-02
Computation and Language · Computer Science
Tokenization Is More Than Compression
Craig W. Schmidt, Varshini Reddy, Haoran Zhang, Alec Alameddine +3
2024-10-08
Computation and Language · Computer Science
Ancient Korean Archive Translation: Comparison Analysis on Statistical phrase alignment, LLM in-context learning, and inter-methodological approach
Sojung Lucia Kim, Taehong Jang, Joonmo Ahn
2024-07-17
Computation and Language · Computer Science
Impact of Tokenization on Language Models: An Analysis for Turkish
Cagri Toraman, Eyup Halit Yilmaz, Furkan Şahinuç, Oguzhan Ozcelik
2023-03-28
Computation and Language · Computer Science
BPE Gets Picky: Efficient Vocabulary Refinement During Tokenizer Training
Pavel Chizhov, Catherine Arnett, Elizaveta Korotkova, Ivan P. Yamshchikov
2024-09-10
Computation and Language · Computer Science
Adaptive BPE Tokenization for Enhanced Vocabulary Adaptation in Finetuning Pretrained Language Models
Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly
2025-04-29
Computation and Language · Computer Science
Evaluation of Coding Schemes for Transformer-based Gene Sequence Modeling
Chenlei Gong, Yuanhe Tian, Lei Mao, Yan Song
2025-07-22
Computation and Language · Computer Science
QUAK: A Synthetic Quality Estimation Dataset for Korean-English Neural Machine Translation
Sugyeong Eo, Chanjun Park, Hyeonseok Moon, Jaehyung Seo +3
2022-11-30
Computation and Language · Computer Science
Kosp2e: Korean Speech to English Translation Corpus
Won Ik Cho, Seok Min Kim, Hyunchang Cho, Nam Soo Kim
2021-07-08