中文

LLM对话安全的攻击、防御与评估:综述

计算与语言 2024-03-28 v3 人工智能 计算机与社会 机器学习

摘要

大型语言模型(LLM)现已广泛应用于对话应用中。然而,它们被滥用于生成有害内容的风险引发了严重的社会担忧,并推动了近期关于LLM对话安全的研究。因此,本综述全面概述了近期研究,涵盖LLM对话安全的三个关键方面:攻击、防御与评估。我们的目标是提供一个结构化的总结,以增进对LLM对话安全的理解,并鼓励对该重要课题的进一步研究。为方便参考,我们根据分类体系对本综述中提及的所有研究进行了分类,详见:https://github.com/niconi19/LLM-conversation-safety。

关键词

引用

@article{arxiv.2402.09283,
  title  = {Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey},
  author = {Zhichen Dong and Zhanhui Zhou and Chao Yang and Jing Shao and Yu Qiao},
  journal= {arXiv preprint arXiv:2402.09283},
  year   = {2024}
}

备注

Accepted to NAACL 2024