自动暴露神经对话模型的问题
计算与语言
2021-09-16 v1
摘要
神经对话模型已知存在生成不安全与不一致回复等问题。尽管这些问题关键且普遍,它们大多由模型设计者通过交互手动识别。最近,一些研究指示众包工作者诱导聊天机器人触发此类问题。然而,人类利用诸如仇恨言论等表面线索,而使系统性问题隐藏。在本文中,我们提出包括强化学习在内的两种方法来自动触发对话模型生成有问题的回复。我们展示了我们的方法在暴露最先进对话模型的安全与矛盾问题方面的效果。
引用
@article{arxiv.2109.06950,
title = {Automatically Exposing Problems with Neural Dialog Models},
author = {Dian Yu and Kenji Sagae},
journal= {arXiv preprint arXiv:2109.06950},
year = {2021}
}