以单次样本实现可变形物体在环视场景中的感知 grounding
计算机视觉与模式识别
2025-07-23 v2 机器人学
图像与视频处理
摘要
在机器人中,对可变形物体的感知操控面临诸多挑战,包括组件属性不确定、配置多样、视觉干扰以及提示模糊,这些因素 complicate perception 和 control 任务。为此,我们提出一种 novel 方法,用于在环视场景中进行可变形物体的单次感知 grounding (OS-AGDO),使机器人能够使用最少样本识别以前未见过的、具有不同颜色和形状的可变形物体。具体而言,我们首先引入可变形物体语义增强模块 (DefoSEM),以增强对内部结构的层次化理解,提高即使在组件信息弱的情况下也能准确识别局部特征的能力。随后,我们提出 ORB-增强关键点融合模块 (OEKFM),利用几何约束优化关键组件的特征提取,提高对多样性和视觉干扰的适应性。此外,我们提出一种基于图像数据和任务上下文的实例条件化提示,有效缓解了因提示词导致的区域歧义问题。为验证这些方法,我们构建了一个包含 15 种常见可变形物体及其相关组织动作的多样化真实数据集 AGDDO15。实验结果表明,我们的方法在 KLD、SIM 和 NSS 指标上分别提高了 6.2%、3.2% 和 2.9%,并展现出高水平的泛化性能。源代码和基准数据集已公开发布于 https://github.com/Dikay1/OS-AGDO。
关键词
引用
@article{arxiv.2503.01092,
title = {One-Shot Affordance Grounding of Deformable Objects in Egocentric Organizing Scenes},
author = {Wanjun Jia and Fan Yang and Mengfei Duan and Xianchi Chen and Yinxi Wang and Yiming Jiang and Wenrui Chen and Kailun Yang and Zhiyong Li},
journal= {arXiv preprint arXiv:2503.01092},
year = {2025}
}
备注
Accepted to IROS 2025. Source code and benchmark dataset will be publicly available at https://github.com/Dikay1/OS-AGDO