中文

用于数据聚类的特权信息

机器学习 2013-06-03 v1 机器学习

摘要

许多机器学习算法假设所有输入样本独立同分布于某个共同分布,在无监督学习情况下是输入空间X,在有监督和半监督学习情况下是输入和输出空间X×Y。在过去几年中,人们探索了放松这一假设,并且将额外信息纳入机器学习算法的重要性变得更加明显。传统上,这种信息融合是半监督学习的领域。最近,Vapnik提出了在监督设置下从独立假设空间纳入知识的方法。在这项工作中,我们感兴趣的是探索Vapnik的“大师班学习”思想以及相关的利用特权信息的学习,但是在无监督设置下。将先进的监督学习范式应用于无监督设置,促使我们研究特权数据与技术数据之间的差异。通过我们提出的aRi-MAX方法,KMeans算法的稳定性得到改善,并在人工数据集上实现了最佳聚类解决方案的识别。随后,我们提出了一种基于信息论点积的算法P-Dot。该方法能够单独或组合地利用各种聚类技术,同时融合特权数据和技术数据以改进聚类。将P-Dot方法应用于数字识别任务,在真实场景中证实了我们的发现。

关键词

引用

@article{arxiv.1305.7454,
  title  = {Privileged Information for Data Clustering},
  author = {Jan Feyereisl and Uwe Aickelin},
  journal= {arXiv preprint arXiv:1305.7454},
  year   = {2013}
}

备注

Information Sciences 194, 4-23, 2012