中文

面向部分标注数据的稀疏Fisher线性判别分析

机器学习 2015-09-21 v1 统计方法学

摘要

分类是一种具有许多有用应用的重要工具。在众多分类方法中,Fisher线性判别分析(LDA)是一种利用协方差信息的传统基于模型的方法。然而,在高维、小样本量的情形下,由于样本协方差不可逆,LDA无法直接应用。虽然现代方法旨在处理高维数据,但它们可能无法像LDA那样充分利用协方差信息。因此,在某些情况下,仍然希望使用像LDA这样基于模型的方法进行分类。本文挖掘了LDA在更复杂数据环境下的潜力。在许多实际应用中,手动为观测数据添加标签成本高昂;因此,通常只有一小部分标注数据可用,而大量观测数据没有标签。仅通过标注数据获得良好的分类性能是一个巨大的挑战,尤其是当维度大于标注数据的样本量时。为了克服这一问题,我们提出了一种半监督稀疏LDA分类器,以利用看似无用的未标注数据。它们提供了额外的信息,在某些情况下有助于提升分类性能。我们使用一种直接估计方法来重构LDA并实现稀疏性;同时,我们采用差分凸算法来处理与未标注数据相关的非凸损失函数。我们研究了所提分类器的理论性质。我们的模拟示例有助于理解何时以及如何从未标注数据中提取的信息是有用的。一个真实数据示例进一步说明了所提方法的实用性。

关键词

引用

@article{arxiv.1509.05438,
  title  = {Sparse Fisher's Linear Discriminant Analysis for Partially Labeled Data},
  author = {Qiyi Lu and Xingye Qiao},
  journal= {arXiv preprint arXiv:1509.05438},
  year   = {2015}
}