使用上下文感知分词训练文本到分子模型
计算与语言
2025-09-18 v2 人工智能
摘要
近期,文本到分子模型在各种化学应用(例如药物发现)中展现出了巨大潜力。这些模型通过将分子表示为原子序列来使语言模型适应分子数据。然而,它们依赖于原子级分词,这主要侧重于建模局部连接性,从而限制了模型捕获分子内全局结构上下文的能力。为解决这一问题,我们提出了一种新颖的文本到分子模型,命名为上下文感知分子 T5(CAMT5)。受子结构级上下文在理解分子结构(例如环系统)中重要性的启发,我们为文本到分子模型引入了子结构级分词。基于我们的分词方案,我们开发了一种基于重要性的训练策略,该策略优先考虑关键子结构,使 CAMT5 能够更好地捕获分子语义。大量实验验证了 CAMT5 在各种文本到分子生成任务中的优越性。有趣的是,我们发现 CAMT5 仅使用 2% 的训练 token 即优于最先进的方法。此外,我们提出了一种简单而有效的集成策略,该策略聚合文本到分子模型的输出以进一步提升生成性能。代码可在 https://github.com/Songhyeontae/CAMT5.git 获取。
引用
@article{arxiv.2509.04476,
title = {Training Text-to-Molecule Models with Context-Aware Tokenization},
author = {Seojin Kim and Hyeontae Song and Jaehyun Nam and Jinwoo Shin},
journal= {arXiv preprint arXiv:2509.04476},
year = {2025}
}
备注
EMNLP 2025 Findings