中文

CulinaryCut-VLAP:基于力感知材质点法的食物切割视觉-语言-动作-物理框架

机器人学 2026-01-13 v1 计算机视觉与模式识别

摘要

食物切割是计算机视觉和机器人操作交叉领域中极具实用性却未被充分探索的应用。该任务具有挑战性,因为刀具与可变形材料之间的相互作用高度非线性,常伴随大变形、频繁接触和拓扑变化,这些因素往往阻碍稳定和安全的大规模数据收集。为此,我们提出一种统一框架,将视觉-语言-动作(VLA)数据集与基于材料点法(MPM)构建的物理真实切割模拟器集成。我们的模拟器采用MLS-MPM作为计算核心,减少数值耗散和能量漂移,同时在发生拓扑变化切割时保持旋转和剪切响应。切割过程中,来自粒子与网格之间的冲量交换,用于估计力和应力分布,实现对瞬时接触力和能量传递的稳定跟踪。我们还提供了一个基准数据集,集成多样化的切割轨迹、多视角视觉观测和细粒度语言指令,并包含力-扭矩和工具-姿态标签,以提供物理一致的训练信号。这些组件实现了遵循切割基本物理的学习-评估循环,为发展操纵可变形物体的VLA模型建立了安全、可重复且可扩展的基础。

关键词

引用

@article{arxiv.2601.06451,
  title  = {CulinaryCut-VLAP: A Vision-Language-Action-Physics Framework for Food Cutting via a Force-Aware Material Point Method},
  author = {Hyunseo Koh and Chang-Yong Song and Youngjae Choi and Misa Viveiros and David Hyde and Heewon Kim},
  journal= {arXiv preprint arXiv:2601.06451},
  year   = {2026}
}

备注

16 pages; 15 figures; 5 tables