中文

大语言模型系统的风险分类、缓解与评估基准

计算与语言 2024-01-12 v1 人工智能

摘要

大语言模型(LLMs)在解决各种自然语言处理任务方面具有强大能力。然而,LLM 系统的安全与安保问题已成为其广泛应用的主要障碍。许多研究已广泛调查了 LLM 系统中的风险并制定了相应的缓解策略。OpenAI、Google、Meta 和 Anthropic 等领先企业也在负责任的 LLM 方面做出了大量努力。因此,越来越需要整理现有研究并为社区建立全面的分类体系。在本文中,我们深入探讨了 LLM 系统的四个基本模块,包括用于接收提示的输入模块、基于大规模语料库训练的语言模型、用于开发和部署的工具链模块,以及用于导出 LLM 生成内容的输出模块。在此基础上,我们提出了一个全面的分类法,系统地分析了与 LLM 系统每个模块相关的潜在风险,并讨论了相应的缓解策略。此外,我们回顾了主流的基准测试,旨在促进 LLM 系统的风险评估。我们希望本文能帮助 LLM 参与者采用系统化的视角来构建其负责任的 LLM 系统。

关键词

引用

@article{arxiv.2401.05778,
  title  = {Risk Taxonomy, Mitigation, and Assessment Benchmarks of Large Language Model Systems},
  author = {Tianyu Cui and Yanling Wang and Chuanpu Fu and Yong Xiao and Sijia Li and Xinhao Deng and Yunpeng Liu and Qinglin Zhang and Ziyi Qiu and Peiyang Li and Zhixing Tan and Junwu Xiong and Xinyu Kong and Zujie Wen and Ke Xu and Qi Li},
  journal= {arXiv preprint arXiv:2401.05778},
  year   = {2024}
}