中文

LongSafety:增强长上下文大语言模型的安全性

计算与语言 2025-02-28 v2 人工智能 机器学习

摘要

模型架构和长度外推技术的最新进展显著延长了大语言模型(LLMs)的上下文长度,为其在日益复杂的任务中的应用铺平了道路。然而,尽管长上下文LLM的能力不断增长,长上下文场景中的安全问题仍未得到充分探索。虽然短上下文中的安全对齐已被广泛研究,但长上下文LLM的安全问题尚未得到充分解决。在这项工作中,我们引入了LongSafety,一个全面的长上下文LLM安全对齐数据集,包含10个任务和17k个样本,平均长度为40.9k个token。我们的实验表明,使用LongSafety训练可以增强长上下文安全性能,同时增强短上下文安全性并保持通用能力。此外,我们证明长上下文安全性不等于使用短上下文安全数据的长期上下文对齐,且LongSafety在上下文长度和长上下文安全场景中具有泛化能力。

关键词

引用

@article{arxiv.2411.06899,
  title  = {LongSafety: Enhance Safety for Long-Context LLMs},
  author = {Mianqiu Huang and Xiaoran Liu and Shaojun Zhou and Mozhi Zhang and Qipeng Guo and Linyang Li and Chenkun Tan and Yang Gao and Pengyu Wang and Linlin Li and Qun Liu and Yaqian Zhou and Xipeng Qiu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2411.06899},
  year   = {2025}
}