ClassBases 在 CASE-2022 多语言抗议事件检测任务中的表现:多语言抗议新闻检测与手动创建事件数据集的自动复现
计算与语言
2023-01-18 v1 计算机与社会
机器学习
社会与信息网络
摘要
在本报告中,我们描述了 ClassBases 在多语言抗议事件检测共享任务中的提交。对于多语言抗议新闻检测,我们参与了子任务-1、子任务-2 和子任务-4,分别为文档分类、句子分类和词元分类。在子任务-1中,我们在序列分类设定下的微调中比较了 XLM-RoBERTa-base、mLUKE-base 和 XLM-RoBERTa-large。我们始终使用所提供的每种语言训练数据的组合来训练我们的多语言模型。我们发现较大的模型似乎表现更好,且实体知识有帮助但代价不可忽略。对于子任务-2,我们仅提交了一个用于句子分类的 mLUKE-base 系统。对于子任务-4,我们仅提交了一个用于序列标注的词元分类系统的 XLM-RoBERTa-base。对于手动创建事件数据集的自动复现,我们参与了来自纽约时报新闻语料的 COVID 相关抗议事件。我们创建了一个系统将爬取数据处理为抗议事件数据集。
引用
@article{arxiv.2301.06617,
title = {ClassBases at CASE-2022 Multilingual Protest Event Detection Tasks: Multilingual Protest News Detection and Automatically Replicating Manually Created Event Datasets},
author = {Peratham Wiriyathammabhum},
journal= {arXiv preprint arXiv:2301.06617},
year = {2023}
}
备注
EMNLP workshop 2022. CASE 2022. 1st in Hindi zero-shot protest-event document classification