中文

专门化与分析指令微调及字节级语言模型用于有机反应预测

计算与语言 2024-05-20 v1 人工智能 机器学习 生物大分子

摘要

基于Transformer的编码器-解码器模型在化学反应预测任务中展现了令人印象深刻的结果。然而,这些模型通常依赖于使用数千万未标记分子的预训练,这可能耗时且GPU密集。本工作旨在回答的核心问题之一是:仅基于语言数据预训练的编码器-解码器模型FlanT5和ByT5能否通过任务特定微调有效地专门化用于有机反应预测?我们对过程中的几个关键问题进行了系统的实证研究,包括分词、(面向SMILES的)预训练的影响、微调样本效率以及推理时的解码算法。我们的主要发现表明,尽管FlanT5和ByT5仅在语言任务上预训练,但它们为反应预测的微调提供了坚实基础,从而在此过程中变得“与化学领域兼容”。这表明,在大量未标记分子数据集上进行GPU密集且昂贵的预训练可能有用,但对于利用语言模型进行化学任务并非必需。尽管不同模型之间存在一些差异,但所有模型都达到了可比的Top-1和Top-5准确率。值得注意的是,分词和词汇表修剪对最终性能影响轻微,但可以加速训练和推理;最有效的贪婪解码策略非常有竞争力,而更复杂的解码算法只能带来微小的增益。总之,我们从多个维度评估了FlanT5和ByT5,并基准测试了它们对有机反应预测的影响,这可能指导未来更有效地使用这些最先进的语言模型处理化学相关任务。

关键词

引用

@article{arxiv.2405.10625,
  title  = {Specialising and Analysing Instruction-Tuned and Byte-Level Language Models for Organic Reaction Prediction},
  author = {Jiayun Pang and Ivan Vulić},
  journal= {arXiv preprint arXiv:2405.10625},
  year   = {2024}
}

备注

Preprint