大规模多维时间序列数据的Shapley值新型应用:将可解释人工智能应用于DNA轮廓分类神经网络
定量方法
2024-09-30 v1 机器学习
基因组学
机器学习
摘要
将Shapley值应用于高维、类似时间序列的数据具有计算挑战——有时甚至不可行。对于N个输入,问题的计算复杂度为。在图像处理中,称为超像素的像素簇用于简化计算。本研究提出了一种高效解决方案,用于类似时间序列的数据,使其适用于Shapley值计算。该方法灵感来自DNA分类示例,适用于由卷积神经网络(CNN)分类的多变量时间序列数据。在DNA处理中,重要的是从DNA提取和处理过程中产生的背景噪声中识别等位基因。单个DNA轮廓有个扫描点需要分类,分类决策必须在法庭上具有可辩护性。这意味着分类通常由人类读者执行——这是一个巨大的、耗时的过程。CNN结合快速计算有意义Shapley值的应用为该大型任务提供了一种可能的替代方案。该研究演示了对该巨大任务进行真实、准确且快速计算Shapley值的能力。
引用
@article{arxiv.2409.18156,
title = {A novel application of Shapley values for large multidimensional time-series data: Applying explainable AI to a DNA profile classification neural network},
author = {Lauren Elborough and Duncan Taylor and Melissa Humphries},
journal= {arXiv preprint arXiv:2409.18156},
year = {2024}
}
备注
16 pages, 5 figures