中文

无监督且可解释的域适应方法用于紧急服务推文的快速筛选

计算与语言 2020-10-22 v2 机器学习 社会与信息网络 机器学习

摘要

在灾害事件爆发初期,由于社交网络数据稀疏可得且对正在进行中的危机标注数据集存在实际限制,从社交网络数据中筛选相关信息颇具挑战。在本文中,我们假设通过多任务学习的无监督域适应可成为一种有用的框架,以利用过往危机事件的数据来训练新危机突然爆发时高效的信息筛选模型。我们提出了一种无需见到任何新样本即可对进行中危机的相关推文进行分类的新方法,使用公开可用的 TREC 事件流数据集。具体而言,我们构建了一个定制化的多任务架构,带有用于危机分析的多域判别器:多任务域对抗注意力网络。该模型为每个任务配备专用的注意力层以提供模型可解释性;这对真实应用至关重要。由于深度网络在稀疏数据集上表现不佳,我们展示了可通过共享一个基底层用于多任务学习与域对抗训练来改善。域适应在危机事件上的评估通过选取一个目标事件作为测试集、在其余数据上训练来完成。我们的结果表明多任务模型优于其单任务对应模型。对于可解释性的定性评估,我们展示了注意力层可用作解释模型预测的引导,并通过展示推文中在分类过程中被认为重要的词语,赋予紧急服务探索模型问责性的能力。最后,我们通过提供 COVID-19 大流行的用例展示了我们工作的实际意义。

关键词

引用

@article{arxiv.2003.04991,
  title  = {Unsupervised and Interpretable Domain Adaptation to Rapidly Filter Tweets for Emergency Services},
  author = {Jitin Krishnan and Hemant Purohit and Huzefa Rangwala},
  journal= {arXiv preprint arXiv:2003.04991},
  year   = {2020}
}

备注

8 pages, 4 Figures, 6 Tables, Source Code Available