中文

招聘中的 Trojan Horse:标准模型与推理模型间间接提示注入的红队测试案例研究

密码学与安全 2026-02-24 v1 人工智能

摘要

随着大语言模型(LLM)日益集成到自动化决策管道中,尤其是人力资源(HR)领域,间接提示注入(Indirect Prompt Injection,IPI)的安全性影响日益关键。虽然已有假设认为“推理”或“链路思考”模型因能够自我纠正而具备安全优势,但最新研究表明,这些能力可能导致更复杂的对齐失效。本篇定性红队测试案例研究挑战了安全通过推理的假设,采用 Qwen 3 30B 架构进行测试。通过对标准指令微调模型和推理增强模型施加“Trojan Horse”简历 curriculum,观察到不同的失效模式。结果表明存在复杂的权衡:标准模型会因简单攻击而进行脆弱的幻觉,以正当化攻击,并在复杂情境中过滤掉不合逻辑的约束;而推理模型则表现出危险的二元性:它运用高级战略重构使简单攻击高度具说服力,却在面对逻辑复杂的命令时出现“元认知泄漏”。本研究突显了一种失效模式:处理复杂对抗指令的认知负荷会导致注入逻辑意外地被打印在最终输出中,使攻击对人类而言更易被检测。

关键词

引用

@article{arxiv.2602.18514,
  title  = {Trojan Horses in Recruiting: A Red-Teaming Case Study on Indirect Prompt Injection in Standard vs. Reasoning Models},
  author = {Manuel Wirth},
  journal= {arXiv preprint arXiv:2602.18514},
  year   = {2026}
}

备注

43 pages, 3 synthetic CV PDF's, 6 chat history PDF's and system prompts. This work was developed as part of the Responsible AI course within the Mannheim Master in Data Science (MMDS) program at the University of Mannheim