中文

时序上下文感知:针对大语言模型多轮操纵攻击的防御框架

密码学与安全 2025-03-21 v1 机器学习

摘要

大语言模型(LLM)日益暴露于 sophisticated 多轮操纵攻击的威胁之下,这类攻击 adversaries 通过看似无害的对话轮次策略性地构建上下文,以规避安全措施并诱发有害或未授权的响应。这些攻击利用对话的时序特性,规避单轮检测方法,成为实际部署中至关重要的安全漏洞。本文引入时序上下文感知(Temporal Context Awareness, TCA)框架,一种新型防御机制,旨�解决此挑战,通过持续分析语义漂移、跨轮意图一致性以及演变中的对话模式。TCA 框架集成动态上下文嵌入分析、跨轮一致性验证和渐进式风险评分,以有效检测和缓解操纵尝试。针对模拟对抗情景的初步评估表明,该框架有潜力识别传统检测技术常忽视的微妙操纵模式,为对话式 AI 系统提供所需的安全层。除阐述 TCA 的设计外,我们分析了多样化的攻击向量及其在多轮对话中的进程,为理解对抗性战术及其对 LLM 漏洞的影响提供了宝贵见解。我们的发现凸显了在对话式 AI 系统中构建稳健、上下文感知防御的紧迫性,并将 TCA 框架作为保障 LLM 安全的有前景方向,同时保持合法应用的实用性。我们将该实现公开,以支持该新兴 AI 安全领域的进一步研究。

关键词

引用

@article{arxiv.2503.15560,
  title  = {Temporal Context Awareness: A Defense Framework Against Multi-turn Manipulation Attacks on Large Language Models},
  author = {Prashant Kulkarni and Assaf Namer},
  journal= {arXiv preprint arXiv:2503.15560},
  year   = {2025}
}

备注

6 pages, 2 figures, IEEE CAI