中文

检测神经序列到序列模型中的恶劣响应

人工智能 2018-10-04 v2

摘要

本工作中,我们尝试回答一个关键问题:是否存在某些输入序列会导致训练良好的离散空间神经网络序列到序列(seq2seq)模型生成恶劣输出(攻击性、恶意、攻击性等)。若此类输入存在,如何高效找到它们。我们采用经验方法:首先创建恶劣输出序列列表,然后设计离散优化算法寻找会导致模型生成这些输出的输入序列。此外,该优化算法针对大词表搜索进行了增强,并约束为搜索真实用户可能输入的输入序列。在我们的实验中,我们将此方法应用于在三个真实对话数据集(Ubuntu、Switchboard 和 OpenSubtitles)上训练的对话响应生成模型,测试模型是否能生成恶意响应。我们证明,给定算法找到的触发输入,大量恶意句子被模型赋予高概率,这揭示了标准 seq2seq 训练的一个不良后果。

关键词

引用

@article{arxiv.1809.04113,
  title  = {Detecting egregious responses in neural sequence-to-sequence models},
  author = {Tianxing He and James Glass},
  journal= {arXiv preprint arXiv:1809.04113},
  year   = {2018}
}