Z-Index在CheckThat! Lab 2022:推文文本的可核查性识别
计算与语言
2022-07-18 v1 机器学习
摘要
社交媒体与数字技术的广泛使用便利了各类事件与活动相关新闻和信息的分享。尽管正面信息得以分享,误导性与虚假信息也在社交媒体上传播。无论是人工专家还是自动工具,已有诸多识别此类误导信息的努力。由于含事实声明的海量信息涌现于线上,人工努力难以规模化。因此,自动识别值得核查的声明对人类专家极为有用。本研究描述我们参与CLEF 2022的CheckThat! lab子任务1A:推文(英语、荷兰语、西班牙语)可核查性的工作。我们执行标准预处理步骤并应用不同模型识别给定文本是否值得事实核查。我们使用过采样技术平衡数据集,并应用带TF-IDF表示的SVM与随机森林(RF)。我们还使用BERT多语言(BERT-m)与XLM-RoBERTa-base预训练模型实验。官方提交使用BERT-m,我们的系统在西班牙语、荷兰语和英语中分别排名第3、第5和第12。进一步实验中,我们的评估显示transformer模型(BERT-m与XLM-RoBERTa-base)在荷兰语与英语上优于SVM和RF,而西班牙语呈现不同情形。
引用
@article{arxiv.2207.07308,
title = {Z-Index at CheckThat! Lab 2022: Check-Worthiness Identification on Tweet Text},
author = {Prerona Tarannum and Firoj Alam and Md. Arid Hasan and Sheak Rashed Haider Noori},
journal= {arXiv preprint arXiv:2207.07308},
year = {2022}
}
备注
Accepted in CLEF 2022