中文

一种用于冷启动主动学习文本分类任务的新型双步骤微调管道

机器学习 2024-07-25 v1 数据库 信息检索

摘要

这是首个研究BERT基上下文嵌入在主动学习 (AL) 任务中效果的工作,针对传统方法在缺乏标签数据的情况下无法进行微调的冷启动场景。我们的主要贡献是提出一种更稳健的微调管道 - DoTCAL - 通过两个步骤减少对标签数据的依赖:(1) 通过掩码语言模型充分利用无标签数据进行域适应嵌入,(2) 使用AL选择的标签数据进一步调整模型权重。我们的评估对比了BERT基嵌入与其他流行的文本表示范式,包括词袋 (BoW)、潜在语义索引 (LSI) 和FastText,在AL过程的两个关键阶段:实例选择和分类。在八个ATC基准测试上进行的实验,考虑到不同AL预算(标记实例数量)和实例数量(约5,000至300,000),表明DoTCAL在效果上具有优势,相较于传统单步骤方法,在宏平均F1指数上提升最高可达33%,同时将标注工作量减半。我们还发现,在几个任务中,BoW和LSI(由于信息聚合)产生的结果在BERT方面更佳(最高可达59%),尤其是在低预算场景和难以分类的任务中,这相当令人惊讶。

关键词

引用

@article{arxiv.2407.17284,
  title  = {A Novel Two-Step Fine-Tuning Pipeline for Cold-Start Active Learning in Text Classification Tasks},
  author = {Fabiano Belém and Washington Cunha and Celso França and Claudio Andrade and Leonardo Rocha and Marcos André Gonçalves},
  journal= {arXiv preprint arXiv:2407.17284},
  year   = {2024}
}

备注

11 pages, 4 figures, 2 Tables, and 1 algorithm