中文

面向分子基础模型的分词技术

机器学习 2026-01-29 v3 人工智能 化学物理 生物大分子

摘要

文本基础模型已成为科学发现中的重要组成部分,分子基础模型正在推动材料科学和分子设计领域的进展。然而,现有模型受限于封闭词汇的分词器,仅覆盖分子空间的有限部分。本文系统评估了 34 种分词器,包括 19 种化学专用分词器,揭示了其在 SMILES 分子表示覆盖范围方面的显著差距。为评估分词器选择的影响,我们引入 n-gram 语言模型作为低成本代理,并通过对 18 个类 RoBERTa 编码器进行预训练和微调来验证其有效性,用于分子属性预测。为克服现有分词器的局限性,我们提出两种新型分词器——Smirk 和 Smirk-GPE,涵盖 OpenSMILES 规范的完整范围。所提出的分词器系统性地集成了核子、电子和几何自由度;促进了药理学、农业、生物学和能源存储等应用。我们的结果凸显了开放词汇建模和化学多样化基准在计算化学中的必要性。

关键词

引用

@article{arxiv.2409.15370,
  title  = {Tokenization for Molecular Foundation Models},
  author = {Alexius Wadell and Anoushka Bhutani and Venkatasubramanian Viswanathan},
  journal= {arXiv preprint arXiv:2409.15370},
  year   = {2026}
}

备注

26 pages, 4 figures