通过概念门控视觉蒸馏克服视觉语言动作模型中的视觉杂凑
计算机视觉与模式识别
2026-03-12 v1 人工智能
机器人学
系统与控制
系统与控制
摘要
视觉语言动作(VLA)模型在零样本情境下表现出色,但在杂凑环境中常出现“精确-推理鸿沟”。此失败由背景引起的特征稀释所致,后者使高频语义噪声破坏了精确操作所需的几何定位。为弥合此差距,我们提出概念门控视觉蒸馏(CGVD)方法,作为一种无训练、模型无关的推理框架来稳定 VLA 策略。CGVD 通过解析指令获得安全集合与干扰集合,运用交叉验证与空间消歧两层目标细化过程,显式惩罚误报并隔离真实操作目标。随后通过傅里叶基擦除生成干净观测,主动抑制语义干扰,同时保留关键空间几何与视觉本体感。广泛的在高度杂凑操作任务上的评估表明,CGVD 防止了性能崩溃。在稠密语义干扰的环境中,我们的方法显著优于最先进的基线,成功率达 77.5%,而基线仅为 43.0%。通过强制严格属性遵循,CGVD 确立了推理时视觉蒸馏作为稳健机器人操作于杂凑环境中的关键前提条件。
引用
@article{arxiv.2603.10340,
title = {Overcoming Visual Clutter in Vision Language Action Models via Concept-Gated Visual Distillation},
author = {Sangmim Song and Sarath Kodagoda and Marc Carmichael and Karthick Thiyagarajan},
journal= {arXiv preprint arXiv:2603.10340},
year = {2026}
}
备注
7 pages, 4 figures, 3 tables