中文

次要预测能告诉我们什么?基于 SQuAD-v2.0 的问答探索

计算与语言 2022-10-26 v2 人工智能 机器学习

摘要

自然语言处理尤其是问答任务的性能,通常通过将模型最具置信度(首要)预测与标准答案(真实标签)进行比较来衡量。我们提出,量化模型即便在失败样本上距离预测出正确答案有多近也是有用的。我们将一个样本的黄金排序(Golden Rank, GR)定义为其与某一真实答案完全匹配的最具置信度预测的排序,并说明此类匹配为何必然存在。对于我们分析的 16 个 transformer 模型,在次要预测空间中完全匹配的黄金答案大多非常接近顶部排序。我们将置信概率降序排列中排序高于 0 的预测称为次要预测。我们展示了如何利用 GR 对问题进行分类并可视化其难度谱,从持续接近成功到持续极端失败。我们推导出一种在整个测试集上的新聚合统计量,称为黄金排序插值中位数(Golden Rank Interpolated Median, GRIM),用于量化失败预测与模型首选答案的接近程度。为建立直观理解并探索这些度量的适用性,我们使用斯坦福问答数据集(Stanford Question Answering Dataset, SQuAD-2)以及 Hugging Face hub 上若干流行的 transformer 模型。我们首先证明 GRIM 与 F1 及精确匹配(exact match, EM)分数无直接相关性。随后我们计算并可视化多种 transformer 架构下的这些分数,通过聚类失败预测来探究其在错误分析中的适用性,并比较它们与其他训练诊断指标(如 EM 和 F1 分数)的关系。最后我们提出了若干研究目标,例如拓展这些度量的数据收集以及它们在对抗训练中的可能应用。

关键词

引用

@article{arxiv.2206.14348,
  title  = {What Can Secondary Predictions Tell Us? An Exploration on Question-Answering with SQuAD-v2.0},
  author = {Michael Kamfonas and Gabriel Alon},
  journal= {arXiv preprint arXiv:2206.14348},
  year   = {2022}
}

备注

18 pages, 2 appendices additional 5 pages, 16 figures