利用视觉-语言导航系统的表征漏洞进行恶意路径操纵
机器人学
2024-07-11 v1 人工智能
计算机视觉与模式识别
机器学习
摘要
基于大语言模型在指令理解以及多模态视觉-语言 Transformer 零样本识别方面的空前能力,视觉语言导航(VLN)已成为解决机器人导航自然语言接口诸多基础挑战的有效途径。然而,由于底层嵌入空间缺乏语义信息,此类视觉-语言模型存在固有漏洞。利用近期开发的基于梯度的优化方法,我们证明了对图像进行不可感知的修改,即可使其在视觉-语言模型中的表征与完全不同的图像和无关文本相匹配。在此基础上,我们开发了相关算法,能够对抗性地修改极少量的图像,使得机器人在执行需要多个地标的指令时,会遵循攻击者选定的路线。我们利用近期提出的一种 VLN 系统进行了实验验证;结果表明,对于给定的导航指令,可以诱导机器人遵循截然不同的路线。我们还开发了一种高效的算法来可靠地检测此类恶意修改,其依据的事实是:经过对抗修改的图像对添加的高斯噪声的敏感度远高于原始图像。
引用
@article{arxiv.2407.07392,
title = {Malicious Path Manipulations via Exploitation of Representation Vulnerabilities of Vision-Language Navigation Systems},
author = {Chashi Mahiul Islam and Shaeke Salman and Montasir Shams and Xiuwen Liu and Piyush Kumar},
journal= {arXiv preprint arXiv:2407.07392},
year = {2024}
}
备注
8 pages, 5 figures. This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2024