中文

危机相关短消息分类的跨语言领域自适应

计算与语言 2016-03-30 v2

摘要

快速危机响应需要实时分析消息。灾难发生后,志愿者试图对推文进行分类以确定需求,例如物资、基础设施损坏等。给定标注数据,监督机器学习可帮助分类这些消息。标注数据稀缺导致机器训练性能差。我们能否重用旧推文来训练分类器?我们如何为训练选择标注推文?具体地,我们研究过去事件的标注数据的有用性。不同语言的标注推文有帮助吗?我们观察使用从过去灾难获得的训练集的不同组合训练的分类器的性能。我们在真实危机数据集上进行广泛实验,并显示当源事件和目标事件为同一类型(例如均为地震)时,过去的标注有用。对于相似语言(例如意大利语和西班牙语),跨语言领域自适应有用,然而,对于不同语言(例如意大利语和英语),性能下降。

关键词

引用

@article{arxiv.1602.05388,
  title  = {Cross-Language Domain Adaptation for Classifying Crisis-Related Short Messages},
  author = {Muhammad Imran and Prasenjit Mitra and Jaideep Srivastava},
  journal= {arXiv preprint arXiv:1602.05388},
  year   = {2016}
}

备注

ISCRAM 2016, 10 pages, 4 tables