基于稳定预测的主动学习停止准则分析
机器学习
2015-04-27 v1 计算与语言
机器学习
摘要
在自然语言处理(NLP)社区内,为了缓解新 NLP 系统与技术开发者面临的标注瓶颈,主动学习已被广泛研究与应用。本文首次提出了基于稳定预测(SP)的主动学习停止准则的理论分析。该分析揭示了 SP 方法成功的三个核心要素:(1) 连续训练模型之间 Cohen's Kappa 一致性的界限对模型 F-measure 性能的差异施加了界限;(2) 由于停止集不必被标注,实践中可将其设得很大,有助于保证结果在测试/应用阶段迁移到先前未见过的数据流;(3) 可以获得连续模型间 Kappa 的良好(低方差)样本估计。文中给出了 Kappa 一致性水平与连续模型间性能差异之间关系的证明。具体而言,若两模型间的 Kappa 一致性超过阈值 T(其中 ),则这些模型的 F-measure 性能差异在所有情况下以 为上界。若假定模型正类合取的精确率为 ,则该界限可收紧为 。
引用
@article{arxiv.1504.06329,
title = {Analysis of Stopping Active Learning based on Stabilizing Predictions},
author = {Michael Bloodgood and John Grothendieck},
journal= {arXiv preprint arXiv:1504.06329},
year = {2015}
}
备注
10 pages, 8 tables; appeared in Proceedings of the Seventeenth Conference on Computational Natural Language Learning, August 2013