SPEED++:面向疫情预测与准备的多语言事件抽取框架
计算与语言
2024-10-25 v1 社会与信息网络
摘要
社交媒体往往是社区讨论最新社会趋势的首选平台。先前的研究利用该平台抽取疫情相关信息(如感染情况、预防措施),以提供疫情预测的早期警报。然而,这些研究仅关注英文帖子,而疫情可发生在世界任何角落,早期讨论往往以当地非英文语言进行。本文引入首个多语言事件抽取(Event Extraction, EE)框架SPEED++,用于从多种疾病和语言中抽取疫情事件信息。为此,我们扩展了先前的疫情本体,新增20个论证角色;构建了包含5.1K条推文的多语言EE数据集SPEED++,覆盖四种语言和四种疾病。因在每种语言中标注数据不可行,因此我们开发了零样本跨语言跨疾病模型(仅在英文新冠数据上训练),利用多语言预训练技术,展示其在提取65种不同疾病相关事件方面的有效性。实验表明,本框架可在2019年12月(全球讨论前3周)从中文微博帖子中为新冠疫情提供早期警报,无需任何中文训练数据。此外,我们利用框架的论证抽取能力聚合社区疫情讨论内容,如症状和疗法措施,辅助误information检测和公共注意力监控。总体而言,我们为多语言疫情准备工作奠定了坚实基础。
引用
@article{arxiv.2410.18393,
title = {SPEED++: A Multilingual Event Extraction Framework for Epidemic Prediction and Preparedness},
author = {Tanmay Parekh and Jeffrey Kwan and Jiarui Yu and Sparsh Johri and Hyosang Ahn and Sreya Muppalla and Kai-Wei Chang and Wei Wang and Nanyun Peng},
journal= {arXiv preprint arXiv:2410.18393},
year = {2024}
}
备注
Accepted at EMNLP 2024