中文

面向函数数据机器学习的可解释流水线

机器学习 2025-02-13 v2 机器学习

摘要

机器学习(ML)模型在以预测为目标的应用中取得了成功,但某些模型的算法复杂性使其难以解释。已有方法被提出以提供对这些“黑盒”模型的见解,但当模型输入为函数数据时,专注于监督式机器学习的研究很少。在这项工作中,我们考虑了来自高后果空间的两个应用,其目标是使用函数数据输入进行预测。一个应用旨在对材料类型进行分类,以根据材料的高光谱计算机断层扫描识别爆炸物。另一个应用考虑了法医科学任务,即使用拉曼光谱提取的颜色签名将喷墨打印文档连接到源打印机。分析这些数据的一个直觉途径是使用数据驱动的机器学习模型进行分类,但由于应用的高后果性质,我们认为在分析中适当考虑数据的性质以不掩盖或歪曲模式非常重要。因此,我们提出了用于训练具有函数数据的机器学习模型的变量重要性可解释弹性形状分析(VEESA)流水线,该流水线(1)考虑了函数数据中的垂直和水平变异性,并(2)在原始数据空间中提供了模型如何使用函数数据中的变异性进行预测的解释。该流水线利用弹性函数主成分分析(efPCA)生成不相关的模型输入,并利用置换特征重要性(PFI)识别对预测重要的主成分。由重要主成分捕获的变异性在原始数据空间中进行可视化。我们最终讨论了 VEESA 流水线的自然扩展想法和未来研究的挑战。

关键词

引用

@article{arxiv.2501.07602,
  title  = {An Explainable Pipeline for Machine Learning with Functional Data},
  author = {Katherine Goode and J. Derek Tucker and Daniel Ries and Heike Hofmann},
  journal= {arXiv preprint arXiv:2501.07602},
  year   = {2025}
}