特征冗余与特权信息情形下序数回归的特征相关性判定
机器学习
2020-05-07 v1 信息检索
机器学习
摘要
机器学习技术的进步带来了日益强大的模型,尤其是在大数据背景下。然而,许多应用场景需要具有稳健可解释性的模型,而非最优的模型精度;例如,若需基于一组给定测量值发现潜在的生物标志物或因果因素,便是如此。在本文中,我们关注特征选择范式,其使我们能够基于稀疏模型揭示给定规律的相关因素。我们聚焦于线性序数回归这一重要特定设定,即数据须通过线性投影被排序至有限个有序类别之一。与以往工作不同,我们考虑特征可能冗余的情形,因而不存在唯一的最小相关特征集。我们旨在识别所有强相关与弱相关特征及其相关性类型(强或弱);我们通过确定特征相关性界来实现这一目标,该界分别对应在所有等价模型上搜索得到的最小与最大特征相关性。此外,我们讨论了该设定如何使我们能够替换部分特征(例如基于其语义),以及如何将特征相关性区间的框架扩展至特权信息设定,即潜在相关信息仅可用于训练目的,但无法用于预测本身。
引用
@article{arxiv.1912.04832,
title = {Feature Relevance Determination for Ordinal Regression in the Context of Feature Redundancies and Privileged Information},
author = {Lukas Pfannschmidt and Jonathan Jakob and Fabian Hinder and Michael Biehl and Peter Tino and Barbara Hammer},
journal= {arXiv preprint arXiv:1912.04832},
year = {2020}
}
备注
Preprint accepted at Neurocomputing