中文

GUARD:基于自适应角色扮演和越狱诊断的指南遵循测试

计算与语言 2026-05-12 v3 人工智能 计算机视觉与模式识别

摘要

随着大语言模型(LLM)越来越重要地融入各个领域,其生成有害响应的潜力引发了重大的社会和监管关注。作为响应,各国政府已发布伦理指南以推动可信赖AI的发展。然而,这些指南通常是面向开发者和测试人员的高层要求,缺少将其转化为可操作测试问题以验证LLM合规性的具体措施。为此,我们介绍GUARD(Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics),一种旨在将指南转化为具体指南违规问题以评估LLM遵守情况的测试方法。为实现这一目标,GUARD使用基于政府发布指南的自动化指南违规问题生成,测试响应是否符合这些指南。当响应直接违反指南时,GUARD报告不一致情况。此外,对于不直接违反指南的响应,GUARD集成了“越狱”概念进行诊断,称为GUARD-JD,该方法创建旨在引发不道德或指南违规响应的情景,从而有效识别可能绕过内置安全机制的潜在情景。我们的方法最终产生合规报告,阐明遵守程度并突出显示任何违规。我们在八个LLM(包括Vicuna-13B、LongChat-7B、Llama2-7B、Llama-3-8B、GPT-3.5、GPT-4、GPT-4o和Claude-3.7)上进行了实证验证,通过测试三个政府发布的指南并进行越狱诊断来验证其有效性。此外,GUARD-JD可将越狱诊断转移到视觉语言模型(MiniGPT-v2和Gemini-1.5), demonstrating其在促进可靠LLM-based应用中的用途。

关键词

引用

@article{arxiv.2508.20325,
  title  = {GUARD: Guideline Upholding Test through Adaptive Role-play and Jailbreak Diagnostics for LLMs},
  author = {Haibo Jin and Ruoxi Chen and Peiyan Zhang and Andy Zhou and Zelei Cheng and Haohan Wang},
  journal= {arXiv preprint arXiv:2508.20325},
  year   = {2026}
}

备注

56 pages