草莓问题:分词化语言模型中字符级理解的涌现
计算与语言
2025-09-17 v3
摘要
尽管大型语言模型(LLM)在各类领域取得显著进展, 但它们始终在简单字符级任务(如统计单词中字母数目)方面失败, 这是由于分词这一根本局限. 本文将该局限表述为低互信息问题, 并从概念涌现角度进行分析. 通过一套19个合成任务在受控环境中隔离字符级推理, 我们表明此类能力在训练后期才会突然涌现. 我们发现, 基于滴发概念涌现的模型解释了这些模式, 这表明学习字符组成与学习常识知识并非根本不同. 为缓解这一瓶颈, 我们提出一种轻量级架构修改, 显著改善字符级推理能力, 同时保持子词模型的归纳优势. 总之, 我们的研究弥补了分词化语言模型中低层感知差距, 并为理解和缓解其结构盲点提供了原则框架. 我们公开代码.
引用
@article{arxiv.2505.14172,
title = {The Strawberry Problem: Emergence of Character-level Understanding in Tokenized Language Models},
author = {Adrian Cosma and Stefan Ruseti and Emilian Radoi and Mihai Dascalu},
journal= {arXiv preprint arXiv:2505.14172},
year = {2025}
}
备注
Accepted at EMNLP 2025 Main as Oral Presentation (Top 15% of accepted papers)