中文

类比相关性指数

机器学习 2023-01-12 v1 人工智能

摘要

聚焦于数据集最显著的特征在机器学习(ML)与数据挖掘中均很有用。在 ML 中,它可带来更高的准确率、更快的学习过程,并最终得到更简单且更易理解的模型。在数据挖掘中,识别显著特征对于更好地理解数据以及可视化都至关重要。本文中,我们展示了一种受类比比例启发的识别显著特征的新方法。此类比例形如“a 之于 b 如同 c 之于 d”,依据相似与相异比较两个物品对 (a, b) 与 (c, d)。在分类语境下,若 a 与 b 之间的相似/相异与 a 和 b 具有不同标签的事实相关,则该知识可迁移至 c 和 d,推断 c 和 d 也具有不同标签。从特征选择视角,观察到大量此类 a 与 b 具有不同标签的配对,可提供关于 a 与 b 相异之处特征重要性的线索。遵循此思路,我们引入类比相关性指数(ARI),一种针对给定特征相对于标签显著性的新统计检验。ARI 是一种基于过滤的方法。基于过滤的方法与 ML 无关,但通常无法处理特征冗余。然而,ARI 能检测特征冗余。我们的实验表明 ARI 是有效的,且在多种人工与部分真实数据集上优于知名方法。

关键词

引用

@article{arxiv.2301.04134,
  title  = {Analogical Relevance Index},
  author = {Suryani Lim and Henri Prade and Gilles Richard},
  journal= {arXiv preprint arXiv:2301.04134},
  year   = {2023}
}

备注

14 pages, 5 figures, 6 tables