标记化瓶颈:词汇扩展如何提升化学表示学习在预训练语言模型中的表现
计算与语言
2025-11-19 v1 人工智能
摘要
大型语言模型(LLM)应用于化学常因针对通用领域文本优化的标记化器将化学表示如 SMILES 片段化为语义无信息的子标记而导致的“标记化瓶颈”。本文提出一种原则性方法,通过统一自然语言和分子结构的表示于单一模型中来解决此瓶颈。我们的做法涉及针对性词汇扩展——增强预训练 LLM 词汇表中加入化学关键标记,随后在化学领域文本上继续预训练以整合新知识。我们提供了该策略的实证效果演示,表明该方法在一系列下游化学任务上表现优于基线。
引用
@article{arxiv.2511.14365,
title = {The Tokenization Bottleneck: How Vocabulary Extension Improves Chemistry Representation Learning in Pretrained Language Models},
author = {Prathamesh Kalamkar and Ned Letcher and Meissane Chami and Sahger Lad and Shayan Mohanty and Prasanna Pendse},
journal= {arXiv preprint arXiv:2511.14365},
year = {2025}
}