中文

超越防护栏:探索ChatGPT的安全风险

密码学与安全 2023-05-16 v1 人工智能 计算与语言 计算机与社会 人机交互

摘要

诸如ChatGPT之类的大语言模型(LLM)日益流行,引发了人们对其安全性、安全风险和伦理影响的日益关注。本文旨在概述与ChatGPT相关的各类安全风险,包括恶意文本与代码生成、私有数据泄露、欺诈性服务、信息收集以及生成不道德内容。我们呈现了一项实证研究,考察ChatGPT内容过滤器的有效性,并探索绕过这些防护栏的潜在方式,揭示了即便存在保护措施,LLM中依然存在的伦理影响与安全风险。基于对安全影响的定性分析,我们讨论了缓解这些风险的潜在策略,并告知研究人员、政策制定者和行业从业者有关类似ChatGPT的LLM所带来的复杂安全挑战。本研究为关于LLM伦理与安全影响的持续讨论作出贡献,强调了在该领域持续研究的必要性。

关键词

引用

@article{arxiv.2305.08005,
  title  = {Beyond the Safeguards: Exploring the Security Risks of ChatGPT},
  author = {Erik Derner and Kristina Batistič},
  journal= {arXiv preprint arXiv:2305.08005},
  year   = {2023}
}