面向用户生成数据中短文本分类的多视图主动学习
计算与语言
2022-12-22 v2 机器学习
摘要
挖掘用户生成数据常受限于标注数据不足、文档长度短以及用户语言非正式等问题。本文提出一种新颖的主动学习模型,以克服针对查询短语任务(例如检测自然灾害的正面报告)中的这些障碍。我们的模型有三处创新:1)它是该领域首个采用多视图主动学习的方法;2)它使用Parzen-Rosenblatt窗方法将代表性度量整合进多视图主动学习;3)它采用基于预测器间一致性的委员会查询策略,以应对该领域文档通常带有的噪声语言。我们在四个具有明显不同应用的公开Twitter数据集上评估了我们的模型,并与包括多分类器在内的广泛基线进行比较。实验证明我们的模型高度一致,且优于现有模型。
引用
@article{arxiv.2112.02611,
title = {Multi-View Active Learning for Short Text Classification in User-Generated Data},
author = {Payam Karisani and Negin Karisani and Li Xiong},
journal= {arXiv preprint arXiv:2112.02611},
year = {2022}
}
备注
EMNLP Findings 2022