中文

大规模多维时间序列数据的Shapley值新型应用:将可解释人工智能应用于DNA轮廓分类神经网络

定量方法 2024-09-30 v1 机器学习 基因组学 机器学习

摘要

将Shapley值应用于高维、类似时间序列的数据具有计算挑战——有时甚至不可行。对于N个输入,问题的计算复杂度为2N2^N。在图像处理中,称为超像素的像素簇用于简化计算。本研究提出了一种高效解决方案,用于类似时间序列的数据,使其适用于Shapley值计算。该方法灵感来自DNA分类示例,适用于由卷积神经网络(CNN)分类的多变量时间序列数据。在DNA处理中,重要的是从DNA提取和处理过程中产生的背景噪声中识别等位基因。单个DNA轮廓有31,20031,200个扫描点需要分类,分类决策必须在法庭上具有可辩护性。这意味着分类通常由人类读者执行——这是一个巨大的、耗时的过程。CNN结合快速计算有意义Shapley值的应用为该大型任务提供了一种可能的替代方案。该研究演示了对该巨大任务进行真实、准确且快速计算Shapley值的能力。

关键词

引用

@article{arxiv.2409.18156,
  title  = {A novel application of Shapley values for large multidimensional time-series data: Applying explainable AI to a DNA profile classification neural network},
  author = {Lauren Elborough and Duncan Taylor and Melissa Humphries},
  journal= {arXiv preprint arXiv:2409.18156},
  year   = {2024}
}

备注

16 pages, 5 figures