中文

用于评估大型语言模型风险的对话复杂度

人工智能 2024-12-02 v3 计算与语言 信息论 math.IT

摘要

大型语言模型(LLMs)呈现出双重用途困境:它们启用了有益的应用,同时潜在地造成伤害,尤其是通过对话交互。尽管有各种安全措施,先进的LLM仍然脆弱。2023年初的一个案例是记者Kevin Roose与LLM驱动的搜索引擎Bing进行的长期对话,揭示了在探询问题后产生有害输出,凸显了模型安全措施的漏洞。这与更简单的早期越狱(如“奶奶越狱”)形成对比,用户将请求包装成为为奶奶提供无辜帮助,很容易引发类似内容。这引出了一个问题:需要多少对话努力才能从LLM中获取有害信息?我们提出两种措施来量化这种努力:对话长度(CL),衡量获取特定有害响应所需的对话轮数;对话复杂度(CC),定义为导致有害响应的用户指令序列的柯克莫尔复杂度。为了解决柯克莫尔复杂度的不可计算性,我们使用参考LLM来估计用户指令的可压缩性,从而近似计算CC。我们将这种方法应用于大型红队测试数据集,进行定量分析,检查有害和无害对话长度和复杂度的统计分布。我们的实证发现表明,这种分布分析和最小化CC作为理解AI安全的有价值工具,提供了关于有害信息可达性的见解。本工作为一种新的LLM安全视角奠定了基础,核心是通往伤害的路径算法复杂度。

关键词

引用

@article{arxiv.2409.01247,
  title  = {Conversational Complexity for Assessing Risk in Large Language Models},
  author = {John Burden and Manuel Cebrian and Jose Hernandez-Orallo},
  journal= {arXiv preprint arXiv:2409.01247},
  year   = {2024}
}

备注

15 pages, 6 figures