用于机器人操控的可解释对抗鲁棒视觉-语言-动作模型
计算机视觉与模式识别
2025-12-16 v1 人工智能
机器人学
摘要
智慧农业已成为通过自动化和智能控制推动现代农业发展的关键技术。然而,依赖RGB相机进行感知和机械臂进行控制的系统在智慧农业中很常见,这些系统容易受到光度扰动(如色调、光照和噪声变化)的影响,在对抗攻击下可能导致故障。为了解决这一问题,我们提出了一个基于OpenVLA-OFT框架的可解释对抗鲁棒视觉-语言-动作模型。该模型集成了一个Evidence-3模块,用于检测光度扰动并生成其原因和影响的自然语言解释。实验表明,与基线相比,所提出的模型将当前动作L1损失降低了21.7%,将下一动作L1损失降低了18.4%,展示了在对抗条件下改进的动作预测准确性和可解释性。
引用
@article{arxiv.2512.11865,
title = {Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation},
author = {Ju-Young Kim and Ji-Hong Park and Myeongjun Kim and Gun-Woo Kim},
journal= {arXiv preprint arXiv:2512.11865},
year = {2025}
}
备注
Accepted to MobieSec 2025 (poster session)