中文

超越冰山一角:评估文本分类器的连贯性

计算与语言 2021-09-13 v1

摘要

随着大规模预训练语言模型在现有语言理解任务上达到人类水平甚至超人类的准确率,基准数据中的统计偏差和探针研究最近对其真实能力提出了质疑。为了提供比文本分类任务准确率更具信息量的评估,我们提出通过一种新颖的预测连贯性测度来评估系统。我们将我们的框架应用于两个具有不同属性的现有语言理解基准,以展示其通用性。我们的实验结果表明,这种评估框架尽管在理念和实现上很简单,却是一种快速、有效且通用的测度,能够为机器预测的连贯性提供洞察。

关键词

引用

@article{arxiv.2109.04922,
  title  = {Beyond the Tip of the Iceberg: Assessing Coherence of Text Classifiers},
  author = {Shane Storks and Joyce Chai},
  journal= {arXiv preprint arXiv:2109.04922},
  year   = {2021}
}

备注

Accepted to Findings of EMNLP 2021