参考距离估计器
机器学习
2013-08-20 v1 机器学习
摘要
本文对一种称为参考距离估计器 (RDE) 的简单线性分类器进行了理论研究,该分类器将每个特征 j 的权重赋值为 P(r|j)-P(r),其中 r 是与目标类别 y 相关的参考特征。分析表明,如果 r 在预测 y 时的表现优于随机猜测,并且与每个特征 j 条件独立,那么 RDE 将具有与使用金标准 y 训练的分类器 P(y|j)-P(y) 相同的分类性能。由于 P(r|j)-P(r) 的估计不需要标记数据,在上述假设下,使用大量未标记样本训练的 RDE 将接近于使用无限标记样本训练的分类器。针对该假设不成立的情况,我们从理论上分析了影响 RDE 与理想假设下分类器接近程度的因素,并提出了一种算法,利用标记和未标记数据来选择参考特征并组合来自不同参考特征的多个 RDE。在 10 个文本分类任务上的实验结果表明,这种半监督学习方法在使用 5,000 个标记样本和 1300 万个未标记样本时,优于仅使用标记样本的监督方法;在许多任务中,其性能甚至接近于使用 1300 万个标记样本训练的分类器。此外,定理中的界限提供了对分类性能的良好估计,可用于新算法的设计。
引用
@article{arxiv.1308.3818,
title = {Reference Distance Estimator},
author = {Yanpeng Li},
journal= {arXiv preprint arXiv:1308.3818},
year = {2013}
}
备注
10 pages, 2 figures, 1 table