用极其简单的排列愚弄你的(视觉与)语言模型
机器学习
2024-08-05 v3
摘要
大型语言与视觉-语言模型因其指令遵循、上下文学习等方面的出色能力正快速投入实际应用。这迫切需要对它们的鲁棒性进行仔细分析,以使利益相关者能够了解此类模型在任何给定应用中是否以及何时足够可信赖。在本文中,我们强调流行模型中的一个特定漏洞,即多选题问答(MCQA)中的排列敏感性。具体而言,我们通过实证表明流行模型易受多选题提示答案集中的对抗性排列攻击,这令人惊讶,因为模型理想上应像人类一样对提示排列保持不变性。这些漏洞存在于不同模型规模中,并且存在于非常近期的语言与视觉-语言模型中。代码可在 https://github.com/ys-zong/FoolyourVLLMs 获取。
引用
@article{arxiv.2310.01651,
title = {Fool Your (Vision and) Language Model With Embarrassingly Simple Permutations},
author = {Yongshuo Zong and Tingyang Yu and Ruchika Chavhan and Bingchen Zhao and Timothy Hospedales},
journal= {arXiv preprint arXiv:2310.01651},
year = {2024}
}
备注
ICML 2024; v3 fix typo