度量何为重要:以谣言立场分类为例
计算与语言
2020-10-12 v1 机器学习
摘要
立场分类可作为理解用户是否及哪些用户相信在线谣言的有力工具。该任务旨在自动预测回复针对给定谣言的立场,即支持、否认、质疑或评论。已有众多方法被提出,其性能在 2017 与 2019 年的 RumourEval 共享任务中进行了比较。结果表明这是一个具有挑战性的问题,因为自然出现的谣言立场数据高度不平衡。本文具体质疑这些共享任务中所用的评估指标。我们重新评估了提交至两次 RumourEval 任务的系统,并表明两种被广泛采用的指标——准确率与宏平均 F1(macro-F1)——对于四分类不平衡的谣言立场分类任务并不稳健,因为它们错误地偏向那些对多数类具有高度偏斜准确率的系统。为克服该问题,我们提出了用于谣言立场检测的新评估指标。这些指标不仅对不平衡数据稳健,而且能为能够识别两个最具信息量的少数类(支持与否认)的系统打出更高分数。
引用
@article{arxiv.2010.04532,
title = {Measuring What Counts: The case of Rumour Stance Classification},
author = {Carolina Scarton and Diego F. Silva and Kalina Bontcheva},
journal= {arXiv preprint arXiv:2010.04532},
year = {2020}
}
备注
Accepted to AACL-IJCNLP 2020