中文

面向半自动文本分类的效用理论排序

机器学习 2021-09-21 v1

摘要

半自动文本分类(SATC)可定义为对一组D\mathcal{D}自动标注的文本文档进行排序的任务,其方式是:如果人类标注者验证(即检查并适当更正)D\mathcal{D}中排名靠前的部分文档,目标是提高D\mathcal{D}的总体标注准确率,则期望提升最大化。一种明显的SATC策略是将D\mathcal{D}排序,使得分类器以最低置信度标注的文档排在前列。在这项工作中,我们表明该策略是次优的。我们基于验证增益(validation gain)的概念开发了新的效用理论排序方法,验证增益定义为通过验证给定自动标注文档将带来的分类有效性改进。我们还提出了一种用于面向SATC排序方法的新有效性度量,基于通过部分验证给定排序方法生成的列表所带来的分类误差期望减少。我们报告了实验结果,表明相对于上述基线方法,并且根据所提度量,我们的效用理论排序方法能够实现分类误差的显著更高的期望减少量。

关键词

引用

@article{arxiv.1503.00491,
  title  = {Utility-Theoretic Ranking for Semi-Automated Text Classification},
  author = {Giacomo Berardi and Andrea Esuli and Fabrizio Sebastiani},
  journal= {arXiv preprint arXiv:1503.00491},
  year   = {2021}
}

备注

Forthcoming on ACM Transactions on Knowledge Discovery from Data