面向Twitter上待核查声明识别的跨语言迁移学习
计算与语言
2022-11-10 v1 人工智能
信息检索
摘要
社交媒体上错误信息的传播已成为一场不可否认的 infodemic。然而,并非所有传播的声明都同等重要。某些声明一旦扩散,可能具有破坏性,不仅针对个人,也针对组织乃至国家。检测应优先进行事实核查的声明被视为抵御假新闻传播的第一步。由于训练数据仅限于少数几种语言,目前难以开发有监督模型来解决低资源语言上的该问题。因此,我们的工作旨在探究能否利用现有数据集训练模型,以预测其他语言推文中声明的可核查价值。我们借助多语言BERT (mBERT)模型,对五种差异显著语言两两之间的六种跨语言可核查性估计方法进行了系统的比较研究。我们使用一个最先进的多语言Twitter数据集运行实验。结果表明,对某些语言对,零样本跨语言迁移是可行的,且可表现得与在目标语言上训练的单语模型一样好。我们还表明,在某些语言上,该方法优于(或至少可与)最先进模型相媲美。
引用
@article{arxiv.2211.05087,
title = {Cross-lingual Transfer Learning for Check-worthy Claim Identification over Twitter},
author = {Maram Hasanain and Tamer Elsayed},
journal= {arXiv preprint arXiv:2211.05087},
year = {2022}
}