大语言模型安全与防护:基于同伦启发的提示混淆技术洞察
密码学与安全
2026-01-22 v1 机器学习
摘要
在本研究中,我们提出了一种同伦启发的提示混淆框架,以增强对大型语言模型(LLMs)中安全与防护漏洞的理解。通过系统性地应用精心设计的提示,我们展示了潜在模型行为如何以意想不到的方式被影响。我们的实验涵盖了15,732个提示,包括10,000个高优先级案例,在LLama、Deepseek、KIMI(用于代码生成)和Claude上进行了验证。结果揭示了对当前LLM防护措施的关键见解,强调了需要更强大的防御机制、可靠的检测策略以及改进的韧性。重要的是,这项工作为分析和缓解潜在弱点提供了一个原则性框架,旨在推进安全、负责任且值得信赖的人工智能技术。
引用
@article{arxiv.2601.14528,
title = {LLM Security and Safety: Insights from Homotopy-Inspired Prompt Obfuscation},
author = {Luis Lazo and Hamed Jelodar and Roozbeh Razavi-Far},
journal= {arXiv preprint arXiv:2601.14528},
year = {2026}
}