中文

基于模型可解释性的深度主动学习

机器学习 2020-09-08 v4 机器学习

摘要

深度神经网络(DNNs)在各种研究任务中近期取得了成功,然而这严重依赖于大量带标签样本。在实际应用中,这可能需要可观的标注成本。幸运的是,主动学习是一种以最小标注成本训练高性能模型的有前景的方法。在深度学习背景下,主动学习的关键问题是如何精确识别样本对 DNN 的信息量。在本文中,受 DNN 中分段线性可解释性的启发,我们将样本的分段线性可分离区域引入主动学习问题,并提出一种基于模型可解释性的新颖深度主动学习(DAMI)方法。为了保持整个无标签数据的最大代表性,DAMI 尝试在不同的由 DNN 中分段线性可解释性引入的线性可分离区域上选择并标注样本。我们专注于对表格数据建模多层感知机(MLP)。具体而言,我们使用 MLP 中的局部分段解释作为每个样本的表示,并直接运行 K-Center 聚类来选择和标注样本。需注意,DAMI 的整个过程不需要手动调整任何超参数。为验证我们方法的有效性,我们在多个表格数据集上进行了大量实验。实验结果表明,DAMI 持续优于几种最先进的对比方法。

关键词

引用

@article{arxiv.2007.12100,
  title  = {Deep Active Learning by Model Interpretability},
  author = {Qiang Liu and Zhaocheng Liu and Xiaofang Zhu and Yeliang Xiu},
  journal= {arXiv preprint arXiv:2007.12100},
  year   = {2020}
}