Shapley同调:神经网络样本影响的拓扑分析
机器学习
2019-10-16 v1 代数拓扑
机器学习
摘要
为训练机器学习模型而收集的数据样本通常被假设为独立同分布(iid)。近期研究表明该假设可能有问题,因其简化了结构化数据的流形。这推动了数据投毒、模型改进及机器学习模型解释等不同研究领域的发展。本工作中,我们研究样本对其底层流形固有拓扑特征的决定所具有的影响。我们提出Shapley同调框架,为单纯复形同调中样本的影响提供定量度量。通过将影响解释为概率测度,我们进一步定义反映数据流形复杂度的熵。我们的实证研究表明,当使用0维同调在邻域图上时,具有较高影响分数的样本对神经网络确定图连通性的准确性,以及对若干正则文法(其较高熵值意味着更难被学习)具有更大影响。
引用
@article{arxiv.1910.06509,
title = {Shapley Homology: Topological Analysis of Sample Influence for Neural Networks},
author = {Kaixuan Zhang and Qinglong Wang and Xue Liu and C. Lee Giles},
journal= {arXiv preprint arXiv:1910.06509},
year = {2019}
}