大语言模型中是否存在针对对话优化的词元化方法?
计算与语言
2025-06-24 v1 人工智能
摘要
大语言模型(LLM)的计算和能源成本正因模型规模不断增大以及数亿用户对LLM的广泛采用而呈指数级增长。LLM的单位成本即单个词元的计算成本。因此,词元化器在模型效率中扮演着重要角色,训练语料库中词元化器被精心优化以最小化文本词元数。目前最流行的LLM应用之一是与用户交互的聊天机器人。我们提出的一个关键观察是,对于这些聊天机器人,词元化器在用户输入文本和聊天机器人响应文本方面的性能是关键,而这些文本大概率与训练语料库中的文本不同。因此,一个立即提出的问题是:是否存在针对聊天机器人对话优化词元化器的潜在益处?本文探索了这一想法,对不同词元化器使用公开的聊天机器人对话语料库对其词汇表进行重新设计,并评估其在该领域中的性能。结果表明,针对对话优化的词元化器在聊天对话中一致性地减少了词元数,这可以导致5%至10%的能源节省,而对原始训练语料库的词元化效率影响最小甚至略为提升。
引用
@article{arxiv.2506.18674,
title = {Is There a Case for Conversation Optimized Tokenizers in Large Language Models?},
author = {Raquel Ferrando and Javier Conde and Gonzalo Martínez and Pedro Reviriego},
journal= {arXiv preprint arXiv:2506.18674},
year = {2025}
}