LLM对话安全的攻击、防御与评估:综述
计算与语言
2024-03-28 v3 人工智能
计算机与社会
机器学习
摘要
大型语言模型(LLM)现已广泛应用于对话应用中。然而,它们被滥用于生成有害内容的风险引发了严重的社会担忧,并推动了近期关于LLM对话安全的研究。因此,本综述全面概述了近期研究,涵盖LLM对话安全的三个关键方面:攻击、防御与评估。我们的目标是提供一个结构化的总结,以增进对LLM对话安全的理解,并鼓励对该重要课题的进一步研究。为方便参考,我们根据分类体系对本综述中提及的所有研究进行了分类,详见:https://github.com/niconi19/LLM-conversation-safety。
引用
@article{arxiv.2402.09283,
title = {Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey},
author = {Zhichen Dong and Zhanhui Zhou and Chao Yang and Jing Shao and Yu Qiao},
journal= {arXiv preprint arXiv:2402.09283},
year = {2024}
}
备注
Accepted to NAACL 2024