CrisisMatch:面向细粒度灾害推文分类的半监督少样本学习
计算与语言
2023-10-24 v1 机器学习
摘要
Twitter和Facebook等社交媒体上关于自然灾害的实时共享信息,在告知志愿者、应急管理人员和响应组织方面发挥着关键作用。然而,用于监测灾害事件的监督学习模型需要大量标注数据,使其难以在灾害事件中实时使用。为应对这一挑战,我们提出一种半监督少样本学习设定下的细粒度灾害推文分类模型,该设定仅需少量标注数据。我们的模型CrisisMatch利用少量标注数据和大量未标注数据,将推文有效分类至感兴趣的细粒度类别,模拟灾害早期阶段。通过整合有效的半监督学习思想并引入TextMixUp,CrisisMatch在两个灾害数据集上平均取得11.2%的性能提升。我们还进一步分析了标注数据数量的影响及域外结果。
引用
@article{arxiv.2310.14627,
title = {CrisisMatch: Semi-Supervised Few-Shot Learning for Fine-Grained Disaster Tweet Classification},
author = {Henry Peng Zou and Yue Zhou and Cornelia Caragea and Doina Caragea},
journal= {arXiv preprint arXiv:2310.14627},
year = {2023}
}
备注
Accepted by ISCRAM 2023