中文

科学机器学习中用于外推的可解释模型

材料科学 2022-12-21 v1 机器学习

摘要

数据驱动模型是科学发现的核心。在追求最先进模型精度的努力中, 研究者采用日益复杂的机器学习算法, 这些算法在插值场景 (例如随机 k 折交叉验证) 中常优于简单回归, 但外推性能、可迁移性与人类可解释性较差, 限制了其促进新颖科学洞察的潜力。本文在广泛的科学与工程问题中, 侧重材料科学数据集, 考察模型性能与可解释性之间的权衡。我们将黑箱随机森林与神经网络机器学习算法, 同利用简单随机搜索算法发现的可解释输入特征拟合的单特征线性回归之性能进行比较。对于插值问题, 线性回归的平均预测误差为黑箱模型的两倍。值得注意的是, 当预测任务需要外推时, 线性模型的平均误差仅比黑箱模型高 5%, 并在约 40% 的测试预测任务中优于黑箱模型, 这表明因其更优的可解释性、计算开销与易用性, 在许多外推问题中它们可能优于复杂算法。该结果挑战了科学机器学习外推模型受性能与可解释性固有权衡约束的普遍假设。

关键词

引用

@article{arxiv.2212.10283,
  title  = {Interpretable models for extrapolation in scientific machine learning},
  author = {Eric S. Muckley and James E. Saal and Bryce Meredig and Christopher S. Roper and John H. Martin},
  journal= {arXiv preprint arXiv:2212.10283},
  year   = {2022}
}

备注

DISTRIBUTION STATEMENT A (Approved for Public Release, Distribution Unlimited)