中文

JAB:联合对抗提示与信念增强

人工智能 2023-11-17 v1 计算与语言

摘要

随着语言模型在不同应用中的近期激增,对这些模型安全性和鲁棒性的关注变得极为重要。在此我们引入一个联合框架,通过对抗提示和信念增强并利用迭代反馈循环,同时探查并提升黑盒目标模型的鲁棒性。该框架利用自动化红队方法探查目标模型,同时利用信念增强器为目标模型生成指令以提升其对那些对抗探查的鲁棒性。重要的是,对抗模型和信念生成器均利用过往交互的反馈,分别提升对抗提示和信念的有效性。在我们的实验中,我们证明此类框架既能减少动态情形下(对手直接与目标模型交互)的有毒内容生成,也能减少静态情形下(我们使用静态基准数据集评估模型)的有毒内容生成。

关键词

引用

@article{arxiv.2311.09473,
  title  = {JAB: Joint Adversarial Prompting and Belief Augmentation},
  author = {Ninareh Mehrabi and Palash Goyal and Anil Ramakrishna and Jwala Dhamala and Shalini Ghosh and Richard Zemel and Kai-Wei Chang and Aram Galstyan and Rahul Gupta},
  journal= {arXiv preprint arXiv:2311.09473},
  year   = {2023}
}