超越静态感知:将时序上下文集成到 VLMs 用于布料折叠
机器人学
2025-05-13 v1 计算机视觉与模式识别
摘要
操作衣物具有挑战性,原因在于其复杂的动力学、高度的可变形性以及频繁的自遮挡。服装几乎呈现无限种配置,难以定义明确的状态表示。在本文中,我们分析了 BiFold 模型,它从视觉观察中预测以语言为条件的抓取和放置动作,同时通过端到端学习隐式地编码服装状态。为解决如皱折服装或从失败的操作中恢复的情形, BiFold 利用时序上下文来改进状态估计。我们检验了该模型的内部表示,证明其精调和时序上下文能够有效地实现文本与图像区域之间的对齐,以及时序一致性。
引用
@article{arxiv.2505.07600,
title = {Beyond Static Perception: Integrating Temporal Context into VLMs for Cloth Folding},
author = {Oriol Barbany and Adrià Colomé and Carme Torras},
journal= {arXiv preprint arXiv:2505.07600},
year = {2025}
}
备注
Accepted at ICRA 2025 Workshop "Reflections on Representations and Manipulating Deformable Objects". Project page https://barbany.github.io/bifold/