中文

模型何时能从解释中学习?理解解释数据作用的的形式化框架

计算与语言 2021-02-12 v2 人工智能 机器学习

摘要

现有许多方法可用于以任务指令、检索文档以及用户提供的解释和反馈为条件来约束模型输出。这些方法不单纯依赖任务输入与输出的样例,而是利用宝贵的额外数据来提升模型正确性并使所学模型与人类先验对齐。同时,越来越多的证据表明,某些语言模型能够(1)在参数中存储大量知识,以及(2)在测试时基于文本输入对任务进行推理。这些结果提出了一种可能性:对于某些任务,人类无法向模型解释比其已知或可自行推断的更多关于该任务的信息。在本文中,我们研究了在何种情况下针对单个数据点的解释能够(或不能)改善建模性能。为了精细控制数据和解释的重要属性,我们引入了一个用于实验的合成数据集,并且还使用了三个已有的带解释的数据集:e-SNLI、TACRED 和 SemEval。我们首先给出了可用建模方法的形式化框架,其中解释数据可用作模型输入、目标或先验。在论证了解释数据最具前景的角色是作为模型输入之后,我们提出使用基于检索的方法,并展示其以超过 95% 的准确率解决了我们的合成任务,而不使用解释数据的基线方法准确率低于 65%。随后我们识别出基于检索的建模失效的数据集属性。对于三个已有数据集,我们发现解释检索未带来任何提升。借助合成任务中的发现,我们指出这些数据集至少不满足成功建模的六个前提条件之一。我们的代码公开于 https://github.com/peterbhase/ExplanationRoles。

关键词

引用

@article{arxiv.2102.02201,
  title  = {When Can Models Learn From Explanations? A Formal Framework for Understanding the Roles of Explanation Data},
  author = {Peter Hase and Mohit Bansal},
  journal= {arXiv preprint arXiv:2102.02201},
  year   = {2021}
}

备注

25 pages, 20 figures