对抗解码:为对抗目标生成可读文档
计算与语言
2025-03-07 v2 密码学与安全
机器学习
摘要
我们设计、实现并评估了一种新的通用文本生成技术——对抗解码——其能为不同对抗目标生成可读文档。先前方法要么产生易被检测的胶水语,要么无法处理包括嵌入相似性在内的目标。特别是,它们仅适用于直接攻击(如越狱),无法生成针对现实中间接注入的对抗文本,例如:1. 在回答广泛查询类别的 RAG 系统中被检索到的文档;以及2. 影响后续生成的文档。我们还表明,流畅度(低困惑度)并不足以规避过滤器。我们测量了对抗解码在不同目标下的有效性,包括 RAG 毒化、越狱以及规避防御性过滤器,并证明其在生成可读对抗文档方面优于现有方法。
引用
@article{arxiv.2410.02163,
title = {Adversarial Decoding: Generating Readable Documents for Adversarial Objectives},
author = {Collin Zhang and Tingwei Zhang and Vitaly Shmatikov},
journal= {arXiv preprint arXiv:2410.02163},
year = {2025}
}