词汇节省:通过向量算术重塑大语言模型的词汇
计算与语言
2026-04-21 v2
摘要
大语言模型 (LLM) 常将词形变体(例如 walk 与 walked)编码为嵌入空间中的线性方向。然而,标准分词算法将此类变体视为具有不同词汇条目的独立单词,迅速填满受词汇量限制的标记词汇(例如 walk、walking、Walk),以牺牲多样性和多语言覆盖。我们表明,这些变体许多可以由转换向量捕获:即对基础形式嵌入施加加法偏移即可获得相应的单词表示,既适用于输入空间,也适用于输出空间。基于此,我们提出一种紧凑的词汇重塑方式:不为每个词形形式分配唯一标记,而是从共享的基础形式和转换向量中构成(例如 walked = walk + 过去时)。该方法轻量级,仅训练小型适应模块,保持预训练的主干网络冻结。我们在五种语言和多个 LLM 上进行预训练和事后适应,释放 10-40% 的词汇槽位以高效重分配。重要的是,我们同时扩展了对 OOV 单词的词汇覆盖度,且对下游性能影响最小。我们的发现激励了对词汇设计进行重新思考,以实现更贴合语言底层结构和多语言覆盖实际需求的表示。
引用
@article{arxiv.2510.17001,
title = {Vocab Diet: Reshaping the Vocabulary of LLMs via Vector Arithmetic},
author = {Yuval Reif and Guy Kaplan and Roy Schwartz},
journal= {arXiv preprint arXiv:2510.17001},
year = {2026}
}
备注
ACL 2026 Findings