对话模型的对抗过敏感与过稳定策略
计算与语言
2018-09-07 v1 人工智能
摘要
我们提出两类与模型无关的对抗策略,用于揭示若干生成式任务型对话模型的弱点:一类是“不应改变”策略,评估模型对微小且保持语义的编辑的过敏感性;另一类是“应改变”策略,测试模型对细微但改变语义的修改是否过稳定。接下来,我们采用最大间隔方法对负生成样本进行对抗训练。这不仅使目标对话模型对对抗输入更鲁棒,还显著提升了其在原始输入上的表现。此外,在所有策略联合上训练取得了进一步改进,在原始任务上达到了新的 SOTA 性能(亦通过人工评估验证)。除对抗训练外,我们还在模型层面处理鲁棒性任务,将子词单元同时作为输入输出,结果表明所得模型同样具有竞争力,仅需原词汇量的 1/4,且即使未经对抗训练也对其中一种对抗策略(原模型易受其攻击)具有鲁棒性。
引用
@article{arxiv.1809.02079,
title = {Adversarial Over-Sensitivity and Over-Stability Strategies for Dialogue Models},
author = {Tong Niu and Mohit Bansal},
journal= {arXiv preprint arXiv:1809.02079},
year = {2018}
}
备注
CoNLL 2018 (15 pages)