多模态基础模型的对抗鲁棒性研究
机器学习
2023-08-22 v1 人工智能
密码学与安全
摘要
结合视觉与语言模型(如 Flamingo 或 GPT-4)的多模态基础模型近来引起了极大关注。基础模型的对齐用于防止模型输出有毒或有害内容。尽管恶意用户已成功尝试越狱基础模型,但同样重要的问题是诚实用户是否会受到恶意第三方内容的伤害。在本文中,我们表明,为了改变多模态基础模型的 caption 输出而对图像进行的难以察觉的攻击,可被恶意内容提供者用来伤害诚实用户,例如将其引导至恶意网站或传播虚假信息。这表明任何已部署的多模态基础模型都应采用针对对抗攻击的防范措施。
引用
@article{arxiv.2308.10741,
title = {On the Adversarial Robustness of Multi-Modal Foundation Models},
author = {Christian Schlarmann and Matthias Hein},
journal= {arXiv preprint arXiv:2308.10741},
year = {2023}
}
备注
ICCV AROW 2023