解码非线性与复杂性:面向材料科学的深度表格学习方法
材料科学
2025-09-22 v1
摘要
材料数据,尤其是与高温性能相关的数据,因极端偏斜、特征范围广泛、异构性以及复杂关系而给机器学习模型带来重大挑战。虽然树基集合模型(如XGBoost、LightGBM)是表格数据的常用方法,但它们往往难以充分捕捉材料科学数据中微妙相互作用。本研究利用基于编码器-解码器架构和注意力机制的深度学习技术来处理这些复杂性。我们的结果表明,XGBoost在获取最佳损失值和最快的试验持续时间方面取得了最佳性能,但深度编码器解码学习(如析取范式网络(DNF-nets))在捕捉高度偏斜数据分布中的非线性关系方面表现具有竞争力。然而,深度模型如CNN的收敛速度和试验持续时间较慢,表明仍需进一步优化。本研究介绍的模型为增强复杂材料数据集的预测精度提供了稳健且混合的解决方案。
引用
@article{arxiv.2411.18717,
title = {Decoding Non-Linearity and Complexity: Deep Tabular Learning Approaches for Materials Science},
author = {Vahid Attari and Raymundo Arroyave},
journal= {arXiv preprint arXiv:2411.18717},
year = {2025}
}