AffordanceSAM:在可获取性定位中再次-segment anything
计算机视觉与模式识别
2025-08-26 v2
摘要
构建用于识别对象可操作区域的通用可获取性定位模型对于现实世界的应用至关重要。现有方法的训练可分为弱监督和完全监督两种方式。然而,前者需要复杂的训练框架设计,无法在无辅助先验的情况下推断新动作;后者则常因标注数据有限且需从头训练而面临挑战,尽管训练更为简单。本研究聚焦于完全监督的可获取性定位,通过提出AffordanceSAM来克服其局限性,该方法将SAM的泛化能力扩展到可获取性定位。具体而言,我们设计了可获取性适应模块,并策划了粗到细标注数据集C2F-Aff,以三阶段训练方式将SAM的稳健性能可靠地迁移到可获取性领域。实验结果表明,AffordanceSAM在AGD20K基准上实现了领先 (SOTA) 的性能,并展现出强大的泛化能力。
关键词
引用
@article{arxiv.2504.15650,
title = {AffordanceSAM: Segment Anything Once More in Affordance Grounding},
author = {Dengyang Jiang and Zanyi Wang and Hengzhuang Li and Sizhe Dang and Teli Ma and Wei Wei and Guang Dai and Lei Zhang and Mengmeng Wang},
journal= {arXiv preprint arXiv:2504.15650},
year = {2025}
}
备注
SAM Meets Affordance Grounding