TD-TOG数据集:用于目标泛化的零样态和一识任务导向抓取基准
机器人学
2025-06-09 v1
摘要
任务导向抓取(TOG)是机器人任务执行的关键前置步骤,涉及预测有助于预期任务的目标对象区域的抓取位置。现有文献揭示,尽管需求大,但TOG数据集用于训练和基准测试的可用性有限,往往为合成数据,或在掩码注释中存在瑕疵,阻碍模型性能。此外,TOG解决方案通常需要affordance掩码、抓取位置和对象掩码进行训练,但现有数据集通常仅提供这些注释的一个子集。为此,我们引入顶部任务导向抓取(TD-TOG)数据集,旨在训练和评估TOG解决方案。TD-TOG包含1,449个真实世界的RGB-D场景,包括30个对象类别和120个子类别,配有手工标注的对象掩码、affordance和平面矩形抓取位置。数据集还包含用于评估TOG解决方案区分对象子类别的测试集。为满足能够在无需重新训练的情况下适应和操作以前未见过的对象对TOG解决方案的需求,我们提出了一种新型TOG框架,Binary-TOG。Binary-TOG使用零识对象识别,以及针对affordance识别的单样本学习。零识学习使Binary-TOG能够通过文本提示识别多目标场景中的对象,无需视觉参考。在多目标设置下,Binary-TOG实现了68.9%的平均任务导向抓取准确率。最后,本文贡献了一种针对对象泛化在TOG中零识与一识学习比较分析,用于开发未来TOG解决方案。
引用
@article{arxiv.2506.05576,
title = {TD-TOG Dataset: Benchmarking Zero-Shot and One-Shot Task-Oriented Grasping for Object Generalization},
author = {Valerija Holomjova and Jamie Grech and Dewei Yi and Bruno Yun and Andrew Starkey and Pascal Meißner},
journal= {arXiv preprint arXiv:2506.05576},
year = {2025}
}