PromptAttack:利用对抗性提示探查对话状态跟踪器
计算与语言
2023-06-08 v1
摘要
现代对话系统的关键组件是对话状态跟踪器(DST),其用于建模用户的目标与需求。为构建更鲁棒、更可靠的 DST,我们提出一种基于提示的学习方法,可自动生成有效的对抗样本以探查 DST 模型。该方法的两个关键特征是:(i) 仅需 DST 的输出而无需模型参数;(ii) 能够学习生成可针对任意 DST 的自然语言话语。通过对最先进的 DST 进行实验,所提出的框架在保持良好流畅度与低扰动比例的同时,实现了最大的准确率下降与最佳的攻击成功率。我们还展示了生成的对抗样本如何通过对抗训练来增强 DST。这些结果表明了基于提示的攻击对 DST 的威力,并为持续 refinement 留下了开放途径。
引用
@article{arxiv.2306.04535,
title = {PromptAttack: Probing Dialogue State Trackers with Adversarial Prompts},
author = {Xiangjue Dong and Yun He and Ziwei Zhu and James Caverlee},
journal= {arXiv preprint arXiv:2306.04535},
year = {2023}
}
备注
To appear in Findings of ACL 2023