化学 Transformer 压缩以加速分子建模的训练与推理
机器学习
2022-05-17 v1 生物大分子
摘要
Transformer 模型已在分子科学中发展出来,并在定量构效关系(QSAR)与虚拟筛选(VS)等应用中表现出优异性能。然而,相较于其他类型模型,它们规模庞大,导致对硬件要求较高,以缩短训练与推理过程的耗时。本工作中,采用跨层参数共享(CLPS)与知识蒸馏(KD)来缩减分子科学中 Transformer 的规模。两种方法不仅相较原始 BERT 模型具有具竞争力的 QSAR 预测性能,且参数更高效。进一步,通过将 CLPS 与 KD 整合进一个双态化学网络,我们引入了一种新的轻量深度化学 Transformer 模型 DeLiCaTe。DeLiCaTe 捕获通用领域与任务特定知识,因参数与层数分别减少 10 倍与 3 倍,带来训练与推理均快 4 倍。同时,其在 QSAR 与 VS 建模中达到可比性能。此外,我们预期该模型压缩策略为构建用于有机药物与材料设计的有效生成式 Transformer 模型提供路径。
引用
@article{arxiv.2205.07582,
title = {Chemical transformer compression for accelerating both training and inference of molecular modeling},
author = {Yi Yu and Karl Borjesson},
journal= {arXiv preprint arXiv:2205.07582},
year = {2022}
}