中文

使用伪标签训练情感分类器可提升模型跨数据集泛化能力

计算与语言 2021-10-06 v1 机器学习

摘要

本工作解决的问题是:对于一个公开情感分类 API,在跨领域标注数据能力有限的情况下,我们如何建立一个在不同类型数据上表现良好的分类器。我们展示,给定来自不同领域的大量未标注数据,以及由在一个领域的少量标注数据上训练的分类器生成的该数据集伪标签,我们可以训练出一个跨不同数据集泛化更好的情感分类器。

关键词

引用

@article{arxiv.2110.02200,
  title  = {Using Psuedolabels for training Sentiment Classifiers makes the model generalize better across datasets},
  author = {Natesh Reddy and Muktabh Mayank Srivastava},
  journal= {arXiv preprint arXiv:2110.02200},
  year   = {2021}
}