Phi:推理时多模态大语言模型中的偏好劫持
机器学习
2025-09-17 v1
摘要
近年来,多模态大语言模型(MLLM)在各个领域获得了广泛关注。然而,它们的广泛采用也引发了严重的安全担忧。在本文中,我们揭示了 MLLM 的一个新的安全风险:MLLM 的输出偏好可以被精心优化的图像任意操纵。此类攻击通常会产生上下文相关但有偏见的响应,这些响应既不明显有害也不违反伦理,使其难以被检测。具体来说,我们引入了一种新颖的方法,称为偏好劫持(Phi),用于使用偏好劫持图像来操纵 MLLM 的响应偏好。我们的方法在推理时工作,无需修改模型。此外,我们引入了一种通用劫持扰动——一种可迁移的组件,可以嵌入到不同的图像中,以将 MLLM 的响应劫持到攻击者指定的任何偏好。跨各种任务的实验结果证明了我们方法的有效性。Phi 的代码可在 https://github.com/Yifan-Lan/Phi 获取。
引用
@article{arxiv.2509.12521,
title = {Phi: Preference Hijacking in Multi-modal Large Language Models at Inference Time},
author = {Yifan Lan and Yuanpu Cao and Weitong Zhang and Lu Lin and Jinghui Chen},
journal= {arXiv preprint arXiv:2509.12521},
year = {2025}
}