LIBERO-PRO:面向越狱记忆的视觉-语言-动作模型的稳健与公平评估
计算机视觉与模式识别
2026-05-26 v2 机器人学
摘要
LIBERO 已成为评估视觉-语言-动作(VLA)模型广泛采用的基准测试;然而,其当前的训练与评估设置存在问题,常导致性能估计被高估,从而阻碍公平模型比较。为此,我们提出 LIBERO-PRO,这是对 LIBERO 的扩展版基准,系统评估模型在四个维度上的鲁棒性:被操作对象、初始状态、任务指令、环境。实验结果表明,尽管现有模型在标准 LIBERO 评估下准确率超过 90%,但在我们的泛化设置下性能骤降至 0.0%。关键在于,这一差异暴露了模型依赖于训练集中动作序列和环境布局的机械记忆,而非真正的任务理解或环境感知。例如,模型即使目标对象被替换为无关物品,仍会执行抓取动作;当给定损坏指令或杂乱 token 时,其输出亦保持不变。这些发现揭示了当前评估实践的严重缺陷,我们呼吁社区放弃误导性的方法,转而进行稳健的模型泛化与理解评估。我们的代码已公开:https://github.com/Zxy-MLlab/LIBERO-PRO。
引用
@article{arxiv.2510.03827,
title = {LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization},
author = {Xueyang Zhou and Yangming Xu and Guiyao Tie and Yongchao Chen and Guowen Zhang and Duanfeng Chu and Pan Zhou and Lichao Sun},
journal= {arXiv preprint arXiv:2510.03827},
year = {2026}
}
备注
10 pages,7 figures, 0 tables