中文

埃森哲在CheckThat! 2021中的工作:基于语境敏感词汇训练数据增强的有趣声明识别与排序

计算与语言 2021-07-14 v1 信息检索

摘要

本文讨论了埃森哲团队在CLEF2021 CheckThat! Lab任务1中所采用的方法,旨在识别社交媒体中发表的声明是否对广大受众有趣并应被事实核查。提供的Twitter训练与测试数据涵盖英语、阿拉伯语、西班牙语、土耳其语和保加利亚语。声明需被分类(值得核查/不值得核查)并按优先级为事实核查员排序。我们的方法使用了深度神经网络Transformer模型,并在所提供的训练数据集上应用语境敏感的词汇增强以生成额外的训练样本。该增强方法提升了所有语言的性能。总体而言,我们的架构与数据增强流程在阿拉伯语上产生了最佳提交系统,且对于英语、西班牙语、土耳其语和保加利亚语,性能随所提供的训练数据量而扩展。本文研究了每种语言的深度神经网络架构以及所提供的数据,以探明该方法为何对阿拉伯语如此有效,并讨论了可能有助于该问题的额外数据增强措施。

关键词

引用

@article{arxiv.2107.05684,
  title  = {Accenture at CheckThat! 2021: Interesting claim identification and ranking with contextually sensitive lexical training data augmentation},
  author = {Evan Williams and Paul Rodrigues and Sieu Tran},
  journal= {arXiv preprint arXiv:2107.05684},
  year   = {2021}
}

备注

To Appear As: Evan Williams, Paul Rodrigues, Sieu Tran. Accenture at CheckThat! 2021: Interesting claim identification and ranking with contextually sensitive lexical training data augmentation. In: Faggioli et al. Working Notes of CLEF 2021-Conference and Labs of the Evaluation Forum. Bucharest, Romania. 21-24 September 2021