中文

TweetEval:面向推文分类的统一基准与对比评估

计算与语言 2020-10-27 v2 社会与信息网络

摘要

社交媒体自然语言处理的实验格局过于碎片化。每年都提出新的共享任务和数据集,从情感分析等经典任务到反讽检测或表情符号预测。因此,由于既没有标准化的评估协议,也没有在此类领域特定数据上训练的强基线集合,当前的最先进水平并不清晰。在本文中,我们提出一个新的评估框架(TweetEval),由七项异构的 Twitter 特定分类任务组成。我们还提供了一组作为起点的强基线,并比较了不同的语言建模预训练策略。我们的初步实验显示了从现有预训练的通用语言模型出发并继续在 Twitter 语料上训练的有效性。

关键词

引用

@article{arxiv.2010.12421,
  title  = {TweetEval: Unified Benchmark and Comparative Evaluation for Tweet Classification},
  author = {Francesco Barbieri and Jose Camacho-Collados and Leonardo Neves and Luis Espinosa-Anke},
  journal= {arXiv preprint arXiv:2010.12421},
  year   = {2020}
}

备注

Findings of EMNLP 2020. TweetEval benchmark available at https://github.com/cardiffnlp/tweeteval