Dyna-bAbI:以动态合成基准测试释放bAbI的潜力
计算与语言
2021-12-02 v1 人工智能
摘要
尽管神经语言模型在自然语言理解(NLU)任务上常表现惊人地好,其优势与局限仍知之甚少。因此受控合成任务成为诊断模型行为日益重要的资源。本工作聚焦故事理解,其为NLU系统的核心能力。然而,故事理解的主要合成资源bAbI基准缺乏此类可控任务生成的系统机制。我们开发了Dyna-bAbI,一个在bAbI中提供任务生成细粒度控制的动态框架。我们通过构建三个需要组合泛化(原基准缺失的重要评测设定)的新任务来展示我们的思路。我们测试了专为bAbI开发的专用模型以及最先进的预训练方法,发现尽管两种方法均解决了原始任务(>99%准确率),但在组合泛化设定下均未取得成功,表明原始训练数据的局限。我们探索了扩充原始数据的方法,发现尽管使训练数据多样化远比单纯增大数据集规模有用,仍不足以驱动稳健的组合泛化(复杂组合准确率<70%)。我们的结果强调了高度可控任务生成器通过模型与数据开发的良性循环来创建稳健NLU系统的重要性。
引用
@article{arxiv.2112.00086,
title = {Dyna-bAbI: unlocking bAbI's potential with dynamic synthetic benchmarking},
author = {Ronen Tamari and Kyle Richardson and Aviad Sar-Shalom and Noam Kahlon and Nelson Liu and Reut Tsarfaty and Dafna Shahaf},
journal= {arXiv preprint arXiv:2112.00086},
year = {2021}
}
备注
Code and data will be made available at project page: https://tiny.one/8wjxwd7z