深度学习分子嵌入的数据融合用于性质预测
机器学习
2025-08-12 v2
摘要
数据驱动的方法,如深度学习,可以实现对材料性质具有卓越准确性和效率的预测模型。然而,在许多应用中,数据稀疏,这限制了其准确性和适用性。为提高预测效果,已使用迁移学习和多任务学习等技术。多任务学习模型的性能取决于任务之间相关性的强度以及数据集的完整性。标准的多任务模型在稀疏数据集上进行训练时,尤其是在弱相关性性质方面,往往表现不佳。为解决这一问题,我们融合由独立预训练的单任务模型生成的深度学习嵌入, resulting in a multitask model that inherits rich, property-specific representations。通过重用(而非重新训练)这些嵌入,融合后的模型超越了标准的多任务模型,并可以通过更少的可训练参数进行扩展。我们在广泛使用的量子化学小分子基准数据集上演示了这一技术,也演示了一个新编的稀疏数据集,该数据集来自文献和我们自己的量子化学和热力学计算。
引用
@article{arxiv.2504.07247,
title = {Resource-efficient Inference with Foundation Model Programs},
author = {Lunyiu Nie and Zhimin Ding and Kevin Yu and Marco Cheung and Chris Jermaine and Swarat Chaudhuri},
journal= {arXiv preprint arXiv:2504.07247},
year = {2025}
}
备注
COLM 2025 Main Conference Paper