低资源环境下的 COVID-19 相关尼泊尔语推文分类
计算与语言
2022-10-13 v1 人工智能
计算机与社会
机器学习
摘要
全球数十亿人一直在使用当地语言的社交媒体平台,表达对与 COVID-19 疫情相关的各种话题的意见。包括世界卫生组织在内的多个组织已经开发了自动化社交媒体分析工具,将 COVID-19 相关推文分类为各种话题。然而,这些有助于抗击疫情的工具仅限于极少数语言,使得许多国家无法从中受益。尽管正在开发多语言或特定低资源语言的工具,但它们仍需扩大覆盖范围,例如针对尼泊尔语。在本文中,我们确定了使用尼泊尔语的 Twitter 社区中最常见的八个 COVID-19 讨论话题,搭建了一个在线平台以自动收集包含 COVID-19 相关关键词的尼泊尔语推文,将推文分类到这八个话题中,并在基于 Web 的仪表盘中可视化各时期的结果。我们比较了两种 SOTA 多语言语言模型在尼泊尔语推文分类上的性能,一种是通用模型 (mBERT),另一种是尼泊尔语语系特定模型 (MuRIL)。我们的结果表明,模型的相对性能取决于数据规模,MuRIL 在较大数据集上表现更好。标注数据、模型和基于 Web 的仪表盘已在 https://github.com/naamiinepal/covid-tweet-classification 开源。
引用
@article{arxiv.2210.05425,
title = {COVID-19-related Nepali Tweets Classification in a Low Resource Setting},
author = {Rabin Adhikari and Safal Thapaliya and Nirajan Basnet and Samip Poudel and Aman Shakya and Bishesh Khanal},
journal= {arXiv preprint arXiv:2210.05425},
year = {2022}
}
备注
Accepted at the 7th Social Media Mining for Health (#SMM4H) Workshop, co-located at Coling 2022