面向机器阅读的注意力引导答案蒸馏
计算与语言
2018-09-18 v4
摘要
尽管当前的阅读理解系统已取得显著进展,但其令人瞩目的性能往往以集成众多模型为代价。此外,现有方法也容易受到对抗攻击。本文利用知识蒸馏来解决这些问题,旨在将知识从集成模型迁移到单一模型。我们首先证明,应用于答案跨度预测的朴素知识蒸馏对阅读理解系统是有效的。然后我们提出两种新方法,不仅惩罚对混淆答案的预测,还利用从集成中蒸馏出的对齐信息来引导训练。实验表明,我们最好的学生模型在 SQuAD 测试集上相比集成教师模型仅有 0.4% F1 的轻微下降,而在推理时快 12 倍。它甚至在对抗性 SQuAD 数据集和 NarrativeQA 基准上优于教师模型。
引用
@article{arxiv.1808.07644,
title = {Attention-Guided Answer Distillation for Machine Reading Comprehension},
author = {Minghao Hu and Yuxing Peng and Furu Wei and Zhen Huang and Dongsheng Li and Nan Yang and Ming Zhou},
journal= {arXiv preprint arXiv:1808.07644},
year = {2018}
}
备注
To appear at EMNLP 2018