Tx-LLM:用于治疗学的大型语言模型
计算与语言
2024-06-11 v1 人工智能
计算工程、金融与科学
机器学习
摘要
开发治疗药物是一个漫长且昂贵的过程,需要满足许多不同的标准,能够加速这一过程的 AI 模型将具有无与伦比的价值。然而,当前大多数 AI 方法仅处理狭义定义的任务集,通常局限于特定领域。为了弥合这一差距,我们引入了 Tx-LLM,这是一种基于 PaLM-2 微调的通用大型语言模型(LLM),它编码了关于多种治疗方式的知识。Tx-LLM 使用包含 709 个数据集的集合进行训练,这些数据集针对跨越药物发现流程各个阶段的 66 项任务。使用单一的一组权重,Tx-LLM 同时处理各种化学或生物实体(小分子、蛋白质、核酸、细胞系、疾病)并与自由文本交织,使其能够预测广泛的相关属性,在 66 项任务中的 43 项上达到了与最先进(SOTA)技术相媲美的性能,并在 22 项任务上超越了 SOTA。其中,对于将分子 SMILES 表示与文本(如细胞系名称或疾病名称)相结合的任务,Tx-LLM 表现尤为强大,平均超越了同类最佳性能,这可能是由于在预训练期间学习到的上下文。我们观察到了不同药物类型任务之间(例如,涉及小分子的任务和涉及蛋白质的任务)正向迁移的证据,并且我们研究了模型大小、领域微调和提示策略对性能的影响。我们相信 Tx-LLM 迈出了 LLM 编码生化知识的重要一步,并可能在未来作为跨越药物发现开发流程的端到端工具发挥作用。
引用
@article{arxiv.2406.06316,
title = {Tx-LLM: A Large Language Model for Therapeutics},
author = {Juan Manuel Zambrano Chaves and Eric Wang and Tao Tu and Eeshit Dhaval Vaishnav and Byron Lee and S. Sara Mahdavi and Christopher Semturs and David Fleet and Vivek Natarajan and Shekoofeh Azizi},
journal= {arXiv preprint arXiv:2406.06316},
year = {2024}
}