上下文感知分层学习:迈向更安全大语言模型的两步范式
密码学与安全
2025-12-04 v1 人工智能
摘要
大语言模型(LLM)已成为多种应用中的强大工具。然而,其统一的token处理范式在指令处理中引入了关键漏洞,特别是在面对对抗性场景时。在本工作中,我们识别并提出了一种新的漏洞类别,称为工具补全攻击(TCA),该攻击利用函数调用机制来颠覆模型行为。为了评估LLM对此类威胁的鲁棒性,我们引入了工具补全基准(Tool-Completion benchmark),这是一个全面的安全评估框架,揭示即使是最先进的模型仍然容易受到TCA的影响,且攻击成功率惊人地高。为了解决这些漏洞,我们提出了上下文感知分层学习(CAHL),一种复杂的机制,能够动态平衡语义理解与角色特定的指令约束。CAHL利用不同指令片段之间的上下文相关性来建立稳健的上下文感知指令层次结构。大量实验表明,CAHL显著增强了LLM对传统攻击和所提出的TCA的鲁棒性,在零样本评估中展现出强大的泛化能力,同时保持了模型在通用任务上的性能。我们的代码可在 https://github.com/S2AILab/CAHL 获取。
引用
@article{arxiv.2512.03720,
title = {Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs},
author = {Tengyun Ma and Jiaqi Yao and Daojing He and Shihao Peng and Yu Li and Shaohui Liu and Zhuotao Tian},
journal= {arXiv preprint arXiv:2512.03720},
year = {2025}
}