中文

多源层次化预测整合

数据库 2016-08-12 v1 机器学习

摘要

在诸如医疗数据挖掘的大数据应用中,由于隐私问题,有必要为同一实例从多个信息源收集预测,而在聚合多个预测时原始特征被丢弃或保留。此外,需要聚合众包标签以估计数据的真值。由于不完善的预测模型或人类众包工人,噪声和冲突信息普遍存在且不可避免。尽管已有最先进的聚合方法被提出来处理具有扁平结构的标签空间,但随着标签空间变得越来越复杂,标签层次结构下的聚合变得必要但很大程度上被忽视。这些标签层次结构可能信息量很大,因为它们通常由领域专家创建,以理解许多现实案例(如蛋白质功能相互作用或疾病关系)中高度复杂的标签关联。我们提出一种新颖的多源层次化预测整合方法,以有效利用复杂的层次标签结构来解决固有地源于多个不完美来源的噪声和冲突信息。我们将该问题表述为一个具有闭式解的优化问题。所提方法捕获所有信息源的平滑性,并惩罚任何违反由标签层次结构导出的约束的整合结果。层次实例相似性以及整合结果以完全无监督的迭代方式推断。在合成和真实世界数据集上的实验结果表明了所提方法相对于现有替代方案的有效性。

关键词

引用

@article{arxiv.1608.03344,
  title  = {Multi-source Hierarchical Prediction Consolidation},
  author = {Chenwei Zhang and Sihong Xie and Yaliang Li and Jing Gao and Wei Fan and Philip S. Yu},
  journal= {arXiv preprint arXiv:1608.03344},
  year   = {2016}
}