跨任务防御:面向内容安全的指令微调大语言模型
计算与语言
2024-05-27 v1 密码学与安全
摘要
近期研究表明,大语言模型(LLMs)在平衡安全性与实用性方面面临挑战,尤其是在处理用于摘要和翻译等自然语言处理任务的长文本时。尽管已有针对恶意短问题的防御措施,但LLMs安全处理危险长内容(如教授非法活动的手册)的能力仍不明确。本文旨在为LLMs在处理恶意文档与良性自然语言处理任务查询时开发稳健的防御方法。我们构建了一个包含安全相关示例的防御数据集,并提出了单任务和混合任务损失用于指令微调。实验结果表明,通过适当的指令微调,LLMs能够显著增强其安全管理危险内容的能力。此外,加强最易被滥用的任务的防御,能有效保护LLMs免受有害信息的处理。我们还观察到,防御策略中存在效用与安全之间的权衡,而采用我们提出方法的Llama2相比Llama1展现出了明显更优的平衡。
引用
@article{arxiv.2405.15202,
title = {Cross-Task Defense: Instruction-Tuning LLMs for Content Safety},
author = {Yu Fu and Wen Xiao and Jia Chen and Jiachen Li and Evangelos Papalexakis and Aichi Chien and Yue Dong},
journal= {arXiv preprint arXiv:2405.15202},
year = {2024}
}
备注
accepted to NAACL2024 TrustNLP workshop