下定决心!不一致自然语言解释的对抗生成
计算与语言
2020-05-05 v3 人工智能
摘要
为增加对人工智能系统的信任,一个有前景的研究方向是设计能够为自身预测生成自然语言解释的神经网络模型。在本工作中,我们表明此类模型仍然易于生成相互不一致的解释,例如“因为图像中有狗”和“因为[同一]图像中没有狗”,暴露出模型决策过程或解释生成中的缺陷。我们引入一个简单而有效的对抗框架,用于针对不一致自然语言解释的生成对模型进行健全性检查。此外,作为该框架的一部分,我们解决了具有完整目标序列的对抗攻击问题,这一场景在序列到序列攻击中此前未被研究。最后,我们将我们的框架应用于一个提供自然语言解释的最先进神经自然语言推理模型。我们的框架表明,该模型能够生成数量可观的不一致解释。
引用
@article{arxiv.1910.03065,
title = {Make Up Your Mind! Adversarial Generation of Inconsistent Natural Language Explanations},
author = {Oana-Maria Camburu and Brendan Shillingford and Pasquale Minervini and Thomas Lukasiewicz and Phil Blunsom},
journal= {arXiv preprint arXiv:1910.03065},
year = {2020}
}