L+M-24:为ACL 2024语言+分子研讨会构建数据集
计算与语言
2024-07-08 v2 人工智能
生物大分子
定量方法
摘要
语言-分子模型已成为分子发现和理解的一个令人兴奋的方向。然而,由于分子-语言对数据集的稀缺,训练这些模型具有挑战性。目前发布的数据集有:1)小规模且从现有数据库中抓取的;2)大规模但有噪声,通过对科学文献进行实体链接构建的;3)通过使用模板将属性预测数据集转换为自然语言构建的。在本文中,我们详细介绍了为ACL 2024语言+分子研讨会共享任务创建的L+M-24数据集。特别地,L+M-24旨在关注自然语言在分子设计中的三个关键优势:组合性、功能性和抽象性。
引用
@article{arxiv.2403.00791,
title = {L+M-24: Building a Dataset for Language + Molecules @ ACL 2024},
author = {Carl Edwards and Qingyun Wang and Lawrence Zhao and Heng Ji},
journal= {arXiv preprint arXiv:2403.00791},
year = {2024}
}
备注
The dataset, finetuned baselines, and evaluation code are released publicly at https://github.com/language-plus-molecules/LPM-24-Dataset through https://huggingface.co/language-plus-molecules