中文

大语言模型安全与防护:基于同伦启发的提示混淆技术洞察

密码学与安全 2026-01-22 v1 机器学习

摘要

在本研究中,我们提出了一种同伦启发的提示混淆框架,以增强对大型语言模型(LLMs)中安全与防护漏洞的理解。通过系统性地应用精心设计的提示,我们展示了潜在模型行为如何以意想不到的方式被影响。我们的实验涵盖了15,732个提示,包括10,000个高优先级案例,在LLama、Deepseek、KIMI(用于代码生成)和Claude上进行了验证。结果揭示了对当前LLM防护措施的关键见解,强调了需要更强大的防御机制、可靠的检测策略以及改进的韧性。重要的是,这项工作为分析和缓解潜在弱点提供了一个原则性框架,旨在推进安全、负责任且值得信赖的人工智能技术。

关键词

引用

@article{arxiv.2601.14528,
  title  = {LLM Security and Safety: Insights from Homotopy-Inspired Prompt Obfuscation},
  author = {Luis Lazo and Hamed Jelodar and Roozbeh Razavi-Far},
  journal= {arXiv preprint arXiv:2601.14528},
  year   = {2026}
}