中文

扩展的多语言抗议新闻检测——共享任务 1,CASE 2021 与 2022

计算与语言 2022-11-22 v1 人工智能 机器学习

摘要

我们报告 CASE 2022 共享任务 1(多语言抗议事件检测)的结果。该任务是 CASE 2021 的延续,包含四个子任务:i) 文档分类,ii) 句子分类,iii) 事件句子共指识别,以及 iv) 事件抽取。CASE 2022 的扩展在于以更多既有语言(即英语、印地语、葡萄牙语和西班牙语)的数据扩充测试集,并为子任务 1(文档分类)新增普通话、土耳其语和乌尔都语测试数据。我们利用了 CASE 2021 中英语、葡萄牙语和西班牙语的训练数据。因此,对印地语、普通话、土耳其语和乌尔都语文档标签的预测以零样本设定进行。CASE 2022 研讨会也接收针对 CASE 2021 测试数据所开发系统的报告。我们观察到,CASE 2022 参与者提交的最佳系统在零样本设定下对新语言的 F1-macro 介于 79.71 与 84.06 之间。获胜方法主要为模型集成与多语言数据合并。在 CASE 2021 数据上,前两名的提交在所有语言的子任务 1 与子任务 2 上均优于去年的提交。仅以下情形未被 CASE 2021 的新提交超越:子任务 3 葡萄牙语与子任务 4 英语。

关键词

引用

@article{arxiv.2211.11360,
  title  = {Extended Multilingual Protest News Detection -- Shared Task 1, CASE 2021 and 2022},
  author = {Ali Hürriyetoğlu and Osman Mutlu and Fırat Duruşan and Onur Uca and Alaeddin Selçuk Gürel and Benjamin Radford and Yaoyao Dai and Hansi Hettiarachchi and Niklas Stoehr and Tadashi Nomoto and Milena Slavcheva and Francielle Vargas and Aaqib Javid and Fatih Beyhan and Erdem Yörük},
  journal= {arXiv preprint arXiv:2211.11360},
  year   = {2022}
}

备注

To appear in CASE 2022 @ EMNLP 2022