中文

CoCoTen:基于情境联合张量的潜在空间特征检测大语言模型对抗输入

计算与语言 2025-08-29 v3

摘要

大语言模型(LLM)在众多应用中的广泛使用标志着研究与实践的重大进展。然而,其复杂性和难以理解的特性使其易受攻击,尤其是旨在生成有害响应的越狱攻击。为 counter these威胁,发展强大的检测方法对于确保LLM的安全与可靠使用至关重要。本文通过情境联合矩阵(Contextual Co-occurrence Matrix)研究了这一检测问题,该结构在数据稀缺环境中表现出色。我们提出了一种新颖方法,利用情境联合矩阵和张量的潜在空间特征,用于有效识别对抗性和越狱提示。我们的评估显示,该方法仅使用0.5%的标记提示即可实现F1得分0.83,相较于基线提升了96.6%。这一结果凸显了在标记数据稀缺时所学模式的强大性能。此外,我们的方法还显著更快,加速度从2.3倍增至128.4倍。

关键词

引用

@article{arxiv.2508.02997,
  title  = {CoCoTen: Detecting Adversarial Inputs to Large Language Models through Latent Space Features of Contextual Co-occurrence Tensors},
  author = {Sri Durga Sai Sowmya Kadali and Evangelos E. Papalexakis},
  journal= {arXiv preprint arXiv:2508.02997},
  year   = {2025}
}