LIBERO-Para:面向 VLA 模型的 paraphrase 鲁棒性诊断基准与指标
机器学习
2026-03-31 v1
摘要
视觉-语言-动作 (VLA) 模型通过利用预训练的视觉-语言 backbone 在机器人操控中取得强大的性能。然而,在下游机器人场景中,他们通常会用有限数据进行微调,导致对特定指令表述形式过拟合,留下了对 paraphrase 指令鲁棒性的探索未充分。为研究这一差距,我们引入 LIBERO-Para,一个受控基准,独立变化动作表达和对象引用,以进行精细的语言泛化分析。我们观察到在七种 VLA 配置 (0.6B-7.5B) 上,paraphrasing 导致 consistent 性能下降 22-52 pp。这种下降主要由对象级词汇变化驱动:即使是简单的同义替换也会导致显著下降,表明模型依赖于面向表面的匹配而非语义 grounding。此外,80-96% 的失败源于规划级轨迹偏差而非执行错误,表明 paraphrasing 干扰了任务识别。二元成功率将所有 paraphrase 完全等同,掩盖了模型是否在不同难度水平上保持一致表现或依赖更易案例的事实。为此,我们提出 PRIDE 指标,用于量化 paraphrase 的难度,基于语义和句法因素。我们的基准和相应代码已公开:https://github.com/cau-hai-lab/LIBERO-Para
引用
@article{arxiv.2603.28301,
title = {LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models},
author = {Chanyoung Kim and Minwoo Kim and Minseok Kang and Hyunwoo Kim and Dahuin Jung},
journal= {arXiv preprint arXiv:2603.28301},
year = {2026}
}
备注
32 pages, 28 figures