暴露 LLM 漏洞:对抗性诈骗检测与性能
密码学与安全
2025-11-05 v1 人工智能
计算机与社会
社会与信息网络
摘要
我们能否信赖大语言模型 (Large Language Model, LLM) 准确预测诈骗信息?本文探讨了当面对对抗性诈骗信息时,大语言模型在诈骗检测任务中的漏洞。我们通过构建包含细粒度标签的综合数据集来解决此问题,数据集包括原始诈骗信息和对抗性诈骗信息。数据集将诈骗检测任务中传统的二元类别扩展为更细致的诈骗类型。我们的分析表明,对抗性示例利用了大语言模型的漏洞,导致误分类率显著上升。我们评估了大语言模型在这些对抗性诈骗信息上的表现,并提出了提高其鲁棒性的策略。
引用
@article{arxiv.2412.00621,
title = {Exposing LLM Vulnerabilities: Adversarial Scam Detection and Performance},
author = {Chen-Wei Chang and Shailik Sarkar and Shutonu Mitra and Qi Zhang and Hossein Salemi and Hemant Purohit and Fengxiu Zhang and Michin Hong and Jin-Hee Cho and Chang-Tien Lu},
journal= {arXiv preprint arXiv:2412.00621},
year = {2025}
}
备注
4 pages, 2024 IEEE International Conference on Big Data workshop BigEACPS 2024