信任 RoBERTa 而非 BERT:来自自然语言推理任务 CheckList 的洞见
人工智能
2021-07-16 v1
摘要
近期最先进的自然语言理解(NLU)系统经常表现出不可预测的行为,在更简单的推理样例上失败。尽管如此,在量化朝向具有更可预测行为的系统的进展方面关注有限。我们认为基于推理能力的性行为摘要是弥合这一差距的一步。我们为自然语言推理(NLI)任务(一个具代表性的 NLU 任务)创建了 CheckList 测试套件(184K 样例)。我们在该测试套件上对最先进的 NLI 系统进行基准测试,从而揭示关于 BERT 和 RoBERTa 推理能力的细粒度洞见。我们的分析进一步揭示了模型在源自同一模板或不同模板但属于同一推理能力的样例上的一致性缺失,表明通过 CheckList 上的观察来泛化模型行为并非易事。通过用户研究,我们发现用户能够利用行为信息对 RoBERTa 预测的样例比 BERT 的样例更好地进行泛化。
引用
@article{arxiv.2107.07229,
title = {Trusting RoBERTa over BERT: Insights from CheckListing the Natural Language Inference Task},
author = {Ishan Tarunesh and Somak Aditya and Monojit Choudhury},
journal= {arXiv preprint arXiv:2107.07229},
year = {2021}
}
备注
15 pages, 5 figures and 9 tables