中文

基于稳定预测的主动学习停止准则分析

机器学习 2015-04-27 v1 计算与语言 机器学习

摘要

在自然语言处理(NLP)社区内,为了缓解新 NLP 系统与技术开发者面临的标注瓶颈,主动学习已被广泛研究与应用。本文首次提出了基于稳定预测(SP)的主动学习停止准则的理论分析。该分析揭示了 SP 方法成功的三个核心要素:(1) 连续训练模型之间 Cohen's Kappa 一致性的界限对模型 F-measure 性能的差异施加了界限;(2) 由于停止集不必被标注,实践中可将其设得很大,有助于保证结果在测试/应用阶段迁移到先前未见过的数据流;(3) 可以获得连续模型间 Kappa 的良好(低方差)样本估计。文中给出了 Kappa 一致性水平与连续模型间性能差异之间关系的证明。具体而言,若两模型间的 Kappa 一致性超过阈值 T(其中 T>0T>0),则这些模型的 F-measure 性能差异在所有情况下以 4(1T)T\frac{4(1-T)}{T} 为上界。若假定模型正类合取的精确率为 pp,则该界限可收紧为 4(1T)(p+1)T\frac{4(1-T)}{(p+1)T}

关键词

引用

@article{arxiv.1504.06329,
  title  = {Analysis of Stopping Active Learning based on Stabilizing Predictions},
  author = {Michael Bloodgood and John Grothendieck},
  journal= {arXiv preprint arXiv:1504.06329},
  year   = {2015}
}

备注

10 pages, 8 tables; appeared in Proceedings of the Seventeenth Conference on Computational Natural Language Learning, August 2013