MolCap-Arena:语言增强分子性质预测的全面描述基准
计算与语言
2024-11-04 v1 人工智能
生物大分子
摘要
将生物分子建模与自然语言信息相结合,特别是通过大语言模型(LLM),近期已成为一个有前景的跨学科研究领域。LLM经过大量科学文献语料的训练,在理解和推理生物分子方面展现出显著潜力,能够通过提供丰富的上下文和领域知识来增强理解。然而,LLM驱动的洞察能在多大程度上改善复杂预测任务(如毒性)的性能仍不清楚。此外,相关知识能从LLM中提取的程度也尚不明确。在本研究中,我们提出了Molecule Caption Arena:首个LLM增强分子性质预测的全面基准。我们在多样化的预测任务上评估了二十多个LLM,包括通用型和领域专用的分子描述器。为此,我们引入了一种新颖的基于对抗的评分系统。我们的结果证实了LLM提取的知识能够增强最先进的分子表示,且存在显著的模型、提示和数据集特异性差异。代码、资源和数据可在github.com/Genentech/molcap-arena获取。
引用
@article{arxiv.2411.00737,
title = {MolCap-Arena: A Comprehensive Captioning Benchmark on Language-Enhanced Molecular Property Prediction},
author = {Carl Edwards and Ziqing Lu and Ehsan Hajiramezanali and Tommaso Biancalani and Heng Ji and Gabriele Scalia},
journal= {arXiv preprint arXiv:2411.00737},
year = {2024}
}