中文

分子与自然语言之间的翻译

计算与语言 2022-11-07 v3 人工智能

摘要

我们提出 MolT5\textbf{MolT5} ——一种在大量无标注自然语言文本与分子字符串上预训练模型的自我监督学习框架。MolT5\textbf{MolT5} 使得传统视觉-语言任务的崭新、有用且具挑战性的类比成为可能,例如分子描述生成(molecule captioning)与基于文本的从头分子生成(text-based de novo molecule generation)(统称:分子与语言之间的翻译),我们首次对此进行了探索。由于 MolT5\textbf{MolT5} 在单模态数据上预训练模型,它有助于克服化学领域数据稀缺的短板。此外,我们考量了若干指标,包括一种新的基于跨模态嵌入的指标,以评估分子描述生成与基于文本的分子的生成任务。我们的结果表明,基于 MolT5\textbf{MolT5} 的模型能够生成在诸多情况下高质量的产出,包括分子与描述文本。

关键词

引用

@article{arxiv.2204.11817,
  title  = {Translation between Molecules and Natural Language},
  author = {Carl Edwards and Tuan Lai and Kevin Ros and Garrett Honke and Kyunghyun Cho and Heng Ji},
  journal= {arXiv preprint arXiv:2204.11817},
  year   = {2022}
}

备注

Accepted at EMNLP 2022. Data and code can be found on [Github](https://github.com/blender-nlp/MolT5)