中文

FENCE:面向金融领域的双语多模态越狱检测数据集

计算与语言 2026-02-23 v1 人工智能 数据库

摘要

越狱行为对大语言模型(LLM)和视觉语言模型(VLM)的部署构成重大风险。由于VLM处理文本和图像,攻击面更广。然而,现有资源在金融领域尤其稀缺。为填补这一空白,我们提出FENCE——一个双语(韩语-英文)多模态数据集,用于金融应用中的越狱检测器训练与评估。FENCE通过金融相关查询搭配图像导向的威胁,强调领域真实性。实验表明,商业及开源VLM均存在显著脆弱性,其中GPT-4o的攻击成功率可衡量,开源模型暴露程度更高。基于FENCE训练的基线检测器在分布内准确率达99%,并在外部基准测试中保持强性能,凸显该数据集在训练可靠检测模型方面的鲁棒性。FENCE为金融领域多模态越狱检测的进一步发展提供了聚焦资源,支持更安全、更可靠的AI系统在敏感领域的部署。警告:本文包含可能冒犯的示例数据。

关键词

引用

@article{arxiv.2602.18154,
  title  = {FENCE: A Financial and Multimodal Jailbreak Detection Dataset},
  author = {Mirae Kim and Seonghun Jeong and Youngjun Kwak},
  journal= {arXiv preprint arXiv:2602.18154},
  year   = {2026}
}

备注

lrec 2026 accepted paper