中文

Small-Text:用于 Python 文本分类的主动学习库

机器学习 2023-10-10 v7 计算与语言

摘要

我们介绍了 small-text,一个易于使用的主动学习库,它为 Python 中的单标签和多标签文本分类提供基于池的主动学习。它具有众多预先实现的最先进查询策略,其中一些利用了 GPU。标准化接口允许组合各种分类器、查询策略和停止准则,便于快速搭配,并能便捷地开发主动学习实验与应用。为使各类分类器和查询策略可用于主动学习,small-text 集成了数个知名的机器学习库,即 scikit-learn、PyTorch 和 Hugging Face transformers。后两者的集成是可选择性安装的扩展,因此可使用 GPU 但非必需。利用这一新库,我们研究了近期发布的 SetFit 训练范式的性能,将其与原始 transformer 微调进行比较,发现其在分类准确率上与之匹敌,同时在曲线下面积上优于后者。该库以 MIT 许可证发布于 https://github.com/webis-de/small-text,撰写时版本为 1.3.0。

关键词

引用

@article{arxiv.2107.10314,
  title  = {Small-Text: Active Learning for Text Classification in Python},
  author = {Christopher Schröder and Lydia Müller and Andreas Niekler and Martin Potthast},
  journal= {arXiv preprint arXiv:2107.10314},
  year   = {2023}
}

备注

This revision fixes the number of query strategies for modAL, which had remained unchanged from an earlier iteration of the table that did not yet include multi-label strategies