超越核心领域的AI安全:面向招聘筛选的专用LLM应用中的对抗性漏洞
计算与语言
2026-04-28 v2 人工智能
摘要
大型语言模型(LLMs)在文本理解与生成方面表现卓越,适用于代码审查和内容 moderation 等自动化任务。然而,我们的研究识别出了一种漏洞:LLMs 可被输入数据中隐藏的“对抗指令”(例如简历或代码)所操控,导致其偏离既定任务。值得注意的是,尽管针对成熟领域(如代码审查)可能已有防御措施,但在其他常见应用(如简历筛选和同行评审)中往往缺乏防御。本文引入一个基准,评估简历筛选中的此类漏洞,结果显示某些攻击类型的成功率超过80%。我们评估了两种防御机制:基于提示的防御实现10.1%的攻击降低,同时引起12.5%的误拒率增加;而我们提出的FIDS(通过分离检测外来指令)采用LoRA适配实现15.4%的攻击降低,10.4%的误拒率增加。两种方法的组合可实现26.3%的攻击降低,表明训练时防御在安全性和实用性保留方面优于推理时缓解措施。
引用
@article{arxiv.2512.20164,
title = {AI Security Beyond Core Domains: Resume Screening as a Case Study of Adversarial Vulnerabilities in Specialized LLM Applications},
author = {Honglin Mu and Jinghao Liu and Kaiyang Wan and Rui Xing and Xiuying Chen and Timothy Baldwin and Wanxiang Che},
journal= {arXiv preprint arXiv:2512.20164},
year = {2026}
}