中文

NLP任务中的安全对齐:弱对齐的摘要生成作为上下文攻击

计算与语言 2024-06-10 v2

摘要

最近在平衡大型语言模型(LLM)的有用性和安全性方面的进展引发了一个关键问题:主流NLP任务是否充分考虑了安全对齐?我们的研究聚焦于通过对抗攻击获得的安全敏感文档,揭示了各种NLP任务在安全对齐方面的显著差异。例如,LLM可以有效地总结恶意长文档,但通常拒绝翻译它们。这种差异突显了一个先前未识别的漏洞:利用安全对齐较弱的任务(如摘要生成)的攻击可能会损害传统上被认为更鲁棒的任务(如翻译和问答)的完整性。此外,同时使用多个安全对齐较弱的NLP任务会增加LLM无意中处理有害内容的风险。我们在各种安全对齐的LLM(特别是Llama2模型、Gemini和GPT-4)中展示了这些漏洞,表明迫切需要加强广泛NLP任务的安全对齐。

关键词

引用

@article{arxiv.2312.06924,
  title  = {Safety Alignment in NLP Tasks: Weakly Aligned Summarization as an In-Context Attack},
  author = {Yu Fu and Yufei Li and Wen Xiao and Cong Liu and Yue Dong},
  journal= {arXiv preprint arXiv:2312.06924},
  year   = {2024}
}

备注

Accepted to ACL2024 main