HumSet:面向人道主义危机响应的多语言信息抽取与分类数据集
计算与语言
2022-11-08 v3 机器学习
摘要
及时有效地应对人道主义危机需要对大量文本数据进行快速而准确的分析——这一过程可极大受益于在人道主义响应领域经验证和标注数据上训练的专家辅助NLP系统。为支持此类NLP系统的构建,我们引入并发布HumSet,一个由人道主义响应领域专家标注的新颖且丰富的多语言人道主义响应文档数据集。该数据集提供三种语言(英语、法语、西班牙语)的文档,涵盖2018至2021年全球各类人道主义危机。对于每个文档,HUMSET提供所选片段(条目)以及使用通用人道主义信息分析框架标注的每个条目的类别。HUMSET还提供新颖且具挑战性的条目抽取与多标签条目分类任务。本文中,我们朝解决这些任务迈出第一步,并在预训练语言模型(PLM)上进行一系列实验,为该领域未来研究建立强基线。数据集可在 https://blog.thedeep.io/humset/ 获取。
引用
@article{arxiv.2210.04573,
title = {HumSet: Dataset of Multilingual Information Extraction and Classification for Humanitarian Crisis Response},
author = {Selim Fekih and Nicolò Tamagnone and Benjamin Minixhofer and Ranjan Shrestha and Ximena Contla and Ewan Oglethorpe and Navid Rekabsaz},
journal= {arXiv preprint arXiv:2210.04573},
year = {2022}
}
备注
Published at Findings of EMNLP 2022