多标签共识分类
机器学习
2013-10-17 v1 机器学习
摘要
在大数据时代,可以从多个来源收集大量噪声和不完整数据用于预测任务。结合多个模型或数据源有助于抵消低数据质量的影响以及任何单一模型或数据源的偏差,从而提高预测模型的鲁棒性和性能。出于隐私、存储和带宽的考虑,在某些情况下,必须在无法访问原始数据的情况下,结合来自多个模型或数据源的预测以获得最终预测。基于共识的预测组合算法适用于此类情况。然而,目前关于预测组合的研究主要集中在单标签设置上,即一个实例有且仅有一个标签。尽管如此,如今的数据通常是多标签的,需要同时预测多个标签。直接将现有的预测组合方法应用于多标签设置可能导致性能退化。在本文中,我们解决了结合多个多标签分类器预测的挑战,并提出了两种新算法:MLCM-r(用于排名的多标签共识最大化)和 MLCM-a(用于 microAUC 的 MLCM)。这些算法能够捕捉多标签分类中常见的标签相关性,并优化相应的性能指标。在流行多标签分类任务上的实验结果验证了理论分析及所提方法的有效性。
引用
@article{arxiv.1310.4252,
title = {Multilabel Consensus Classification},
author = {Sihong Xie and Xiangnan Kong and Jing Gao and Wei Fan and Philip S. Yu},
journal= {arXiv preprint arXiv:1310.4252},
year = {2013}
}