English

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection

Cryptography and Security 2025-08-12 v1 Artificial Intelligence

Abstract

Ensuring LLM alignment is critical to information security as AI models become increasingly widespread and integrated in society. Unfortunately, many defenses against adversarial attacks and jailbreaking on LLMs cannot adapt quickly to new attacks, degrade model responses to benign prompts, or introduce significant barriers to scalable implementation. To mitigate these challenges, we introduce a real-time, self-tuning (RTST) moderator framework to defend against adversarial attacks while maintaining a lightweight training footprint. We empirically evaluate its effectiveness using Google's Gemini models against modern, effective jailbreaks. Our results demonstrate the advantages of an adaptive, minimally intrusive framework for jailbreak defense over traditional fine-tuning or classifier models.

Keywords

Cite

@article{arxiv.2508.07139,
  title  = {A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection},
  author = {Ivan Zhang},
  journal= {arXiv preprint arXiv:2508.07139},
  year   = {2025}
}

Comments

10 pages, 1 figure

R2 v1 2026-07-01T04:42:45.636Z