未知簇的聚类回归
机器学习
2011-03-24 v1 机器学习
摘要
我们考虑一组预测实验,这些实验在以下意义上是聚类的:即多组实验在预测变量与响应变量之间表现出相似的关系。实验簇以及回归关系均是未知的。回归关系定义了实验簇,并且通常情况下,预测变量与响应变量可能不表现出任何聚类。我们将此预测问题称为未知簇的聚类回归(CRUC),并在本文中聚焦于线性回归。我们研究并比较了几种用于CRUC的方法,展示了它们在Yahoo Learning-to-rank Challenge (YLRC)数据集上的适用性,并研究了相关的数学模型。CRUC处于许多先前工作的交叉路口,我们研究了具有不同起源的几种预测算法:期望最大化算法的改进、受K-means聚类启发的方法、二次约束下矩阵秩极小化的奇异值阈值方法、多元回归中Curds and Whey方法的改进,以及让人联想到协同过滤中邻域方法的局部回归方案。基于在YLRC数据集以及模拟数据上的经验评估,我们确定LoR方法是一个良好的实际选择:它以合理的计算负荷产生最佳或接近最佳的预测性能,并且对算法参数的选择不太敏感。我们还对相关数学模型的LoR方法提供了一些分析,这为最优参数选择和预测性能提供了启示。
引用
@article{arxiv.1103.4480,
title = {Clustered regression with unknown clusters},
author = {Kishor Barman and Onkar Dabeer},
journal= {arXiv preprint arXiv:1103.4480},
year = {2011}
}
备注
9 pages, Submitted to KDD 2011, San Diego