中文

视觉语言模型并非唯一所需:分子语言模型的增强策略

人工智能 2024-07-24 v3

摘要

最近,研究者们对理解分子及其文本描述通过分子语言模型(MoLM)展开了浓厚兴趣。然而,尽管已有初步的积极发展,MoLM的进展仍显著落后于视觉语言模型(VLM)。这主要是由于1)分子-文本配对数据的有限,以及2)由于专家聚焦于特定领域导致的专业知识缺失。为此,我们提出了AMOLE方法,1)通过结构相似性保存损失增强分子-文本配对,2)在分子之间传递专业知识。具体而言,AMOLE通过采用新颖的结构相似性保存损失,在结构相似的分子之间共享描述,从而丰富分子-文本配对。此外,我们提出了专业知识重构损失,用于将来自拥有大量专业知识的分子的知识传递给专业知识较少的分子。广泛的下游任务实验表明,AMOLE在理解分子及其描述方面具有优势,凸显其在实际药物发现中的潜在应用。AMOLE的源码可在https://github.com/Namkyeong/AMOLE获取。

关键词

引用

@article{arxiv.2407.09043,
  title  = {Vision Language Model is NOT All You Need: Augmentation Strategies for Molecule Language Models},
  author = {Namkyeong Lee and Siddhartha Laghuvarapu and Chanyoung Park and Jimeng Sun},
  journal= {arXiv preprint arXiv:2407.09043},
  year   = {2024}
}

备注

CIKM 2024 / ACL 2024 Workshop on Languages and Molecule