基于 Transformer 的问答无监督评估
计算与语言
2020-10-08 v1 人工智能
摘要
在推理时自动评估问答(QA)模型的答案是一项挑战。尽管许多模型提供置信度分数,且简单启发式方法在指示答案正确性方面颇有帮助,但此类度量高度依赖于数据集,难以泛化。本工作中,我们首先考察基于 transformer 的 QA 架构中问题、答案与上下文的隐藏表示。我们观察到答案表示中存在一致的模式,并证明该模式可用于自动评估预测答案片段是否正确。我们的方法不需要任何标注数据,且在 2 个数据集与 7 个领域上优于强启发式基线。我们能在 SQuAD 上以 91.37% 的准确率、在 SubjQA 上以 80.7% 的准确率预测模型答案是否正确。我们期望该方法具有广泛应用,例如用于 QA 数据集的半自动构建。
引用
@article{arxiv.2010.03222,
title = {Unsupervised Evaluation for Question Answering with Transformers},
author = {Lukas Muttenthaler and Isabelle Augenstein and Johannes Bjerva},
journal= {arXiv preprint arXiv:2010.03222},
year = {2020}
}
备注
8 pages, to be published in the Proceedings of the 2020 EMNLP Workshop BlackboxNLP: Analysing and Interpreting Neural Networks for NLP