中文

分类特征主动选择

机器学习 2021-03-01 v1

摘要

一些数据分析应用包含这样的数据集:解释变量获取成本高或繁琐,但辅助数据易于获得,并可能有助于构建有洞察力的训练集。一个例子是精神疾病的神经影像研究,特别是基于昂贵的磁共振成像(MRI)扫描导出的变量学习诊断/预后模型,这通常需要大样本量。辅助数据(如人口统计学信息)可能有助于选择一个更小的样本,其中包含具有信息量最大的 MRI 扫描的个体。尽管在相关的问题设定中 concerning 实例或实例-特征对的选择已有 promising 结果,主动学习文献尚未研究此问题。因此,我们 formulation 这一互补问题——分类特征主动选择(ASCF):给定一个主要任务,需要学习模型 f: x-> y 以解释/预测一组获取昂贵的变量 x 与类标签 y 之间的关系。那么,ASCF 任务是使用一组易于获得的选样变量 z 来选择这些实例,当获取其昂贵特征 z 并将其纳入主要训练集时,将最大程度地提升主要任务的性能。我们针对该问题提出两种基于效用的方法,并在三个公开真实世界基准数据集上评估其性能。此外,我们基于带有真实 MRI 数据的模拟研究设计,说明了这些方法在精神疾病神经影像研究中高效获取 MRI 扫描的应用。

关键词

引用

@article{arxiv.2102.13636,
  title  = {Active Selection of Classification Features},
  author = {Thomas T. Kok and Rachel M. Brouwer and Rene M. Mandl and Hugo G. Schnack and Georg Krempl},
  journal= {arXiv preprint arXiv:2102.13636},
  year   = {2021}
}

备注

Accepted for publication at the 19th Intelligent Data Analysis Symposium, 2021. The final authenticated publication will be made available online at springer.com