中文

FLAME:灵活的大语言模型辅助内容 moderation 引擎

密码学与安全 2025-02-14 v1 人工智能 计算与语言

摘要

大型语言模型(LLM)的快速发展在 moderating 用户-模型交互方面带来了显著挑战。尽管 LLM 展示出惊人的能力,但它们仍然容易受到对抗性攻击,尤其是那些绕过内容安全措施的“劫持”技术。目前依赖输入提示过滤的 content moderation 系统已被证明不够充分,以至于诸如最佳- N(Best-of-N,简称 BoN)劫持技术在流行 LLM 上可达 80% 以上的成功率。在本文中,我们引入灵活的大语言模型辅助 moderation 引擎(FLAME):一种将关注力从输入过滤转向输出 moderating 的新方法。不同于传统的断路方法分析用户查询,FLAME 评估模型响应,具有以下几个关键优势:(1)在训练和推理中的计算效率,(2)对 BoN 劫持攻击的增强抵抗力,(3)通过可定制的话题过滤实现对安全准则的灵活定义和更新。我们的实验表明,FLAME 显著优于当前的 moderation 系统。例如,FLAME 将 GPT-4o-mini 和 DeepSeek-v3 的攻击成功率降低约 9 倍,同时保持低计算开销。我们对 various LLMs 进行了全面评估,并分析了该引擎针对最新劫持技术的效率。本工作为开发更健壮和适应性的内容 moderation 系统作出了贡献。

关键词

引用

@article{arxiv.2502.09175,
  title  = {FLAME: Flexible LLM-Assisted Moderation Engine},
  author = {Ivan Bakulin and Ilia Kopanichuk and Iaroslav Bespalov and Nikita Radchenko and Vladimir Shaposhnikov and Dmitry Dylov and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2502.09175},
  year   = {2025}
}