中文

面向图像安全应用的提示工程大型多模态模型与精调视觉变换器模型效能评估

系统与控制 2024-03-27 v1 系统与控制

摘要

大型语言模型 (LLM) 的成功催生了大型多模态模型 (LMM) 的发展,这些模型正在改变多种应用的面貌。这些高级多模态模型旨在通过整合文本、图像等多种模态来解释和分析复杂数据,从而为一系列应用开辟了新途径。本文考察了面向图像安全应用的提示工程 LMM(如 LLaVA、BakLLaVA、Moondream、Gemini-pro-vision 和 GPT-4o)与精调视觉变换器 (ViT) 模型之间的适用性与有效性。我们聚焦两个独立的安全任务:1) 一个显而易见的任务,即检测简单的触发器,如图像中微小的像素变化,这些变化可能被用于访问模型潜在的后门;2) 一个不那么显而易见的任务,即通过视觉表示进行恶意软件分类。在显而易见的任务中,一些 LMM 如 Gemini-pro-vision 和 GPT-4o 在谨慎的提示工程下表现出良好潜力,GPT-4o 在准确率和 F1 分数上分别达到 91.9% 和 91%。然而,精调的 ViT 模型在该任务中表现出完美的性能,由于该任务的简单性。在不那么显而易见的任务中,结果显示 ViT 模型在预测 25 类恶意软件和 5 类恶意软件家族时分别取得了 97.11% 和 97.61% 的 F1 分数,而 LMM 则在经过多次提示改进后仍表现不佳。该研究不仅展示了提示工程 LMM 在网络安全应用中的优势与局限,还强调了精调 ViT 模型在精确可靠的任务中的卓越效能。

关键词

引用

@article{arxiv.2403.17785,
  title  = {Neural Distributed Controllers with Port-Hamiltonian Structures},
  author = {Muhammad Zakwan and Giancarlo Ferrari-Trecate},
  journal= {arXiv preprint arXiv:2403.17785},
  year   = {2024}
}

备注

This paper is submitted in CDC2024 for a possible publication