面向低资源场景的跨语言与跨领域危机分类
计算与语言
2022-11-01 v2
摘要
社交媒体数据已成为关于真实世界危机事件的及时有用信息来源。与利用社交媒体进行灾害管理相关的主要任务之一是危机相关消息的自动识别。该主题的大多数研究集中于特定语言中某类事件的数据分析。这限制了现有方法的泛化可能性,因为模型无法直接应用于新类型事件或其他语言。本工作中,我们研究通过利用跨语言与跨领域标注数据自动分类危机事件相关消息的任务。我们的目标是利用来自高资源语言的标注数据,对其他(低资源)语言和/或新(先前未见)类型危机情境的消息进行分类。为我们的研究,我们从文献中整合了一个包含多类危机事件和语言的大型统一数据集。我们的实证发现表明,确实有可能利用英语危机事件数据对其他语言(如西班牙语和意大利语)的同类事件进行分类(F1 分数 80.0%)。此外,我们在跨语言设定下对跨领域任务取得了良好性能(F1 分数 80.0%)。总体而言,我们的工作有助于改善对多语言危机分类至关重要的数据稀缺问题,特别是缓解紧急事件中时间至关重要的冷启动情形。
引用
@article{arxiv.2209.02139,
title = {Cross-Lingual and Cross-Domain Crisis Classification for Low-Resource Scenarios},
author = {Cinthia Sánchez and Hernan Sarmiento and Andres Abeliuk and Jorge Pérez and Barbara Poblete},
journal= {arXiv preprint arXiv:2209.02139},
year = {2022}
}
备注
Accepted at the International AAAI Conference on Web and Social Media (ICWSM 2023)