Kov: 基于马尔可夫决策过程与树搜索的可迁移自然化黑箱大语言模型攻击
密码学与安全
2024-08-20 v1 人工智能
计算与语言
机器学习
摘要
从大语言模型(LLM)中提取有害行为是确保模型正确对齐与安全的重要任务。在训练 LLM 时,尽管遵循了伦理准则,但对齐失败仍可能通过红队对抗性攻击暴露出来。本工作将红队测试问题建模为马尔可夫决策过程(MDP),并利用蒙特卡洛树搜索来发现黑箱、闭源 LLM 的有害行为。针对白箱 LLM 优化基于 token 级别的提示后缀以实现定向有害行为,并引入自然化损失项——对数困惑度,以生成更自然的语言攻击,从而提升可解释性。所提出的算法 Kov 在白箱 LLM 上进行训练以优化对抗性攻击,并定期评估黑箱 LLM 的响应以引导搜索朝向更具危害性的黑箱行为。在初步研究中,结果表明我们可以在仅 10 次查询的情况下攻破黑箱模型(如 GPT-3.5),但在 GPT-4 上失败——这可能表明较新的模型对基于 token 级别的攻击具有更强的鲁棒性。所有用于复现这些结果的工作均已开源(https://github.com/sisl/Kov.jl)。
引用
@article{arxiv.2408.08899,
title = {Kov: Transferable and Naturalistic Black-Box LLM Attacks using Markov Decision Processes and Tree Search},
author = {Robert J. Moss},
journal= {arXiv preprint arXiv:2408.08899},
year = {2024}
}