无标签数据在预测建模中的应用
统计方法学
2009-09-29 v1
摘要
在回归与分类分析中引入无标签数据已成为应用统计学与机器学习文献日益关注的焦点,近期诸多实例表明无标签数据有助于提升预测精度。然而,这种半监督分析的统计学基础似乎尚未得到清晰界定;因此,其 underlying 理论与原理可能未被充分重视,尤其是非统计学者。统计学家也有机会更深入地参与到这一统计学与计算机科学交叉重要领域的蓬勃研究中。文献中的大部分理论工作侧重于特定算法背景下无标签数据的几何与结构性质,而非概率与统计问题。本文概述了预测建模的基本统计基础以及与无标签数据相关的一般性问题,强调了抽样设计与先验设定等经典概念的相关性。通过一系列核心示例和两项实质性的真实数据分析,该理论精确展示了无标签数据在何时、为何以及如何发挥作用。
引用
@article{arxiv.0710.4618,
title = {The Use of Unlabeled Data in Predictive Modeling},
author = {Feng Liang and Sayan Mukherjee and Mike West},
journal= {arXiv preprint arXiv:0710.4618},
year = {2009}
}
评论
Published in at http://dx.doi.org/10.1214/088342307000000032 the Statistical Science (http://www.imstat.org/sts/) by the Institute of Mathematical Statistics (http://www.imstat.org)