TweetEval:面向推文分类的统一基准与对比评估
计算与语言
2020-10-27 v2 社会与信息网络
摘要
社交媒体自然语言处理的实验格局过于碎片化。每年都提出新的共享任务和数据集,从情感分析等经典任务到反讽检测或表情符号预测。因此,由于既没有标准化的评估协议,也没有在此类领域特定数据上训练的强基线集合,当前的最先进水平并不清晰。在本文中,我们提出一个新的评估框架(TweetEval),由七项异构的 Twitter 特定分类任务组成。我们还提供了一组作为起点的强基线,并比较了不同的语言建模预训练策略。我们的初步实验显示了从现有预训练的通用语言模型出发并继续在 Twitter 语料上训练的有效性。
引用
@article{arxiv.2010.12421,
title = {TweetEval: Unified Benchmark and Comparative Evaluation for Tweet Classification},
author = {Francesco Barbieri and Jose Camacho-Collados and Leonardo Neves and Luis Espinosa-Anke},
journal= {arXiv preprint arXiv:2010.12421},
year = {2020}
}
备注
Findings of EMNLP 2020. TweetEval benchmark available at https://github.com/cardiffnlp/tweeteval