视觉-语言-动作模型的任务适配:2025 BEHAVIOR挑战赛第一名解决方案
机器人学
2025-12-23 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
我们提出了一种视觉-动作策略,在2025 BEHAVIOR挑战赛中获得第一名——该挑战赛是一个大规模基准测试,包含50个多样化的长时序家庭任务,在照片级真实感模拟中进行,要求双手操作、导航和上下文感知决策。基于Pi0.5架构,我们引入了多项创新。我们的主要贡献是流匹配中的相关噪声,它提高了训练效率并实现了相关感知修复,以生成流畅的动作序列。我们还应用了可学习混合层注意力和System 2阶段跟踪以解决歧义。训练采用多样本流匹配以降低方差,推理则使用动作压缩和挑战特定修正规则。我们的方法在公共和私有排行榜上所有50个任务中实现了26%的q-score。
引用
@article{arxiv.2512.06951,
title = {Task adaptation of Vision-Language-Action model: 1st Place Solution for the 2025 BEHAVIOR Challenge},
author = {Ilia Larchenko and Gleb Zarin and Akash Karnatak},
journal= {arXiv preprint arXiv:2512.06951},
year = {2025}
}
备注
2025 NeurIPS Behavior Challenge 1st place solution