探讨多保真度机器学习中数据层次结构
化学物理
2025-03-26 v2 机器学习
计算物理
摘要
近期进展使高精度量子化学(QC)计算更加可及。特别值得关注的是多保真度机器学习(MFML)方法,其中使用来自不同准确度或保真度的训练数据。这些方法通常采用固定比例因子来关联不同保真度间训练样本的数量,这反映了该数据的成本和假设稀疏性。本研究考察了修改对模型效率和准确性的影响,用于预测基于QeMFi基准数据集的垂直激发能。进一步地,本工作引入基于QC计算时间的比例因子,其取值基于不同保真度的QC计算时间。提出了一种新型误差指标,即MFML的误差等高线,提供了每个保真度贡献的模型误差的综合视图。结果表明,仅需在目标保真度使用2个训练样本,即可通过使用大量来自较低保真度的样本实现高模型精度。这一发现通过一种新颖概念——-曲线——得到进一步阐述,该曲线将模型误差与生成训练样本的时间成本进行比较,表明多保真度模型能够在最小化训练数据成本的同时实现高精度。
引用
@article{arxiv.2410.11392,
title = {Investigating Data Hierarchies in Multifidelity Machine Learning for Excitation Energies},
author = {Vivin Vinod and Peter Zaspel},
journal= {arXiv preprint arXiv:2410.11392},
year = {2025}
}
备注
Modified errors to be relative MAE. Transferability tests of training on QeMFi and testing on QUESTDB have now been added