RLBind:针对统一稳健嵌入的对抗不变跨模态对齐
机器人学
2025-09-19 v1 计算机视觉与模式识别
摘要
将视觉、音频和其他传感器绑定到共享嵌入空间的统一多模态编码器是机器人感知与决策中吸引力的构建块。然而,现场部署暴露了视觉分支面临对抗性和自然损坏,这使得稳健性成为安全的必要条件。以往的防御措施通常在 CLIP 风格的编码器中对齐干净和对抗性特征,忽略更广泛的跨模态对应关系,导致提升有限且常常损害零样本迁移。我们引入 RLBind,一个用于稳健统一嵌入的对抗不变跨模态对齐框架。阶段 1 在干净-对抗性对上进行无监督微调以强化视觉编码器。阶段 2 通过最小化干净/对抗特征与文本锚点之间的差异,同时在模态之间强制执行类别级分布对齐来利用跨模态对应性。大量实验表明,RLBind 在图像、音频、热成像和视频数据上均显著优于 LanguageBind 主干模型和标准微调基线,在干净准确率和受限范数对抗鲁棒性方面均表现出色。通过在不牺牲泛化能力的前提下提高抗性,RLBind 为机器人在导航、操控等自主应用场景中更安全的多传感器感知堆栈提供了实际路径。
引用
@article{arxiv.2509.14383,
title = {RLBind: Adversarial-Invariant Cross-Modal Alignment for Unified Robust Embeddings},
author = {Yuhong Lu},
journal= {arXiv preprint arXiv:2509.14383},
year = {2025}
}
备注
This paper is submitted to IEEE International Conference on Robotics and Automation (ICRA) 2026