中文

基于预训练Transformer语言模型的表示在文本数据集标注主动学习中的有效性研究

信息检索 2020-04-29 v1 计算与语言 机器学习

摘要

主动学习已被证明是缓解利用大量未标注数据进行机器学习任务所需部分标注工作的有效方法。然而,在执行主动学习时用于表示文本文档的表示机制,对这一过程的有效性有显著影响。虽然诸如词袋以及基于 word2vec 等技术的嵌入表示已被证明是主动学习中表示文档的有效方式,但基于自然语言处理研究中流行的预训练 transformer 神经网络模型(如 BERT)的表示机制提供了一种有前景且尚未被充分探索的替代方案。本文对基于预训练 transformer 语言模型的表示在主动学习中的有效性进行了全面评估。该评估表明,尚未在主动学习中广泛使用的 transformer 模型,尤其是类 BERT 模型,相比词袋或更常用的其他经典词嵌入(如 word2vec)等向量表示取得了显著改进。本文还研究了基于 BERT 变体(如 Roberta、Albert)的表示的有效性,并比较了 [CLS] 令牌表示与使用类 BERT 模型可生成的聚合表示的有效性。最后,我们提出了一种自适应调优主动学习(Adaptive Tuning Active Learning)方法。我们的实验表明,主动学习中获取的有限标注信息不仅可用于训练分类器,还可自适应地改进类 BERT 语言模型生成的嵌入。

关键词

引用

@article{arxiv.2004.13138,
  title  = {Investigating the Effectiveness of Representations Based on Pretrained Transformer-based Language Models in Active Learning for Labelling Text Datasets},
  author = {Jinghui Lu and Brian MacNamee},
  journal= {arXiv preprint arXiv:2004.13138},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1910.03505