中文

用于改善数据表示与语义的无监督特征构造

人工智能 2015-12-18 v1 机器学习

摘要

基于特征的格式是机器学习算法使用的主要数据表示格式。当特征不能恰当描述初始数据时,性能开始下降。一些算法通过在内部改变表示空间来解决此问题,但新构造的特征很少是可理解的。我们寻求以无监督方式构造新的特征,这些特征更适合描述给定数据集,同时对人用户而言是可理解的。我们提出两种算法,将新特征构造为初始原始特征或其否定的合取。生成的特征集降低了特征间的相关性,并成功捕捉数据集中个体之间的一些隐藏关系。例如,像 sky¬buildingpanoramasky \wedge \neg building \wedge panorama 这样的特征对于非城市图像为真,并且比表达对象存在或缺失的简单特征更具信息量。帕累托最优性的概念用于评估特征集,并在总相关性与所得特征集的复杂性之间取得平衡。统计假设检验用于自动确定用于构造数据相关特征集的参数值。我们通过实验表明,我们的方法实现了对多个数据集的信息化特征集构造。

关键词

引用

@article{arxiv.1512.05467,
  title  = {Unsupervised Feature Construction for Improving Data Representation and Semantics},
  author = {Marian-Andrei Rizoiu and Julien Velcin and Stéphane Lallich},
  journal= {arXiv preprint arXiv:1512.05467},
  year   = {2015}
}