中文

UniMoT:基于离散标记表示的统一分子-文本语言模型

计算与语言 2025-06-24 v2 人工智能 机器学习

摘要

大型语言模型(LLM)在多样化任务上的显著成功推动了研究社区将其能力扩展至分子应用。然而,大多数分子LLM采用适配器架构,未能平等对待分子和文本模态,且缺乏分子模态的监督信号。为解决这些问题,我们提出了UniMoT,一个统一的分子-文本LLM,采用基于标记器的架构,通过分子标记扩展LLM的词汇表。具体而言,我们引入了一种由向量量化驱动的标记器,该标记器集成了Q-Former以弥合分子与文本之间的模态差距。该标记器将分子转换为具有因果依赖关系的分子标记序列,封装了高级分子和文本信息。配备此标记器后,UniMoT可以在共享标记表示和自回归训练范式下统一分子与文本模态,使其能够将分子解读为一门外语并将其生成为文本。经过四阶段训练方案,UniMoT成为一个能够执行分子到文本和文本到分子任务的多模态通用模型。大量实验表明,UniMoT在广泛的分子理解和生成任务上取得了最先进的性能。

关键词

引用

@article{arxiv.2408.00863,
  title  = {UniMoT: Unified Molecule-Text Language Model with Discrete Token Representation},
  author = {Shuhan Guo and Yatao Bian and Ruibing Wang and Nan Yin and Zhen Wang and Quanming Yao},
  journal= {arXiv preprint arXiv:2408.00863},
  year   = {2025}
}

备注

IJCAI 2025