中文

这是否是诽谤?——面向生成式语言模型的精确输入逆转方法

密码学与安全 2024-07-17 v1 人工智能 计算与语言 机器学习

摘要

大型语言模型(LLM)的训练需要巨大的時間與金錢投入。為了获取良好的投资回报,开发商会付出 considerable 努力确保模型不会产生有害和冒犯性输出。然而,恶意行为者可能尝试通过公开报告伪造输出来抹黑 LLM 的声誉。本文表明,针对此类诽谤攻击的防御需要重建伪造输出的输入,或证明该输入不存在。为此,我们提出并评估了一种基于搜索的针对 LLM 的精准对抗攻击方法。实验表明,我们几乎无法重建任意输出的精确输入,从而表明 LLM 仍然容易受到诽谤攻击。

关键词

引用

@article{arxiv.2407.11059,
  title  = {Was it Slander? Towards Exact Inversion of Generative Language Models},
  author = {Adrians Skapars and Edoardo Manino and Youcheng Sun and Lucas C. Cordeiro},
  journal= {arXiv preprint arXiv:2407.11059},
  year   = {2024}
}

备注

4 pages, 3 figures