由部件级语义先验引导的弱监督可供性定位
计算机视觉与模式识别
2025-06-02 v1
摘要
在这项工作中,我们关注弱监督可供性定位任务,即模型在没有密集标签的情况下,使用人-物交互图像和自我中心物体图像来识别物体上的可供性区域。以往的工作大多建立在类激活图之上,这对于语义分割很有效,但可能不适合定位动作和功能。利用近期先进的预训练大模型,我们开发了一个基于伪标签的有监督训练流程。伪标签由现成的部件分割模型生成,并由可供性到部件名称的映射进行引导。此外,我们为基线模型引入了三项关键增强:标签精炼阶段、细粒度特征对齐过程和轻量级推理模块。这些技术利用现成预训练大模型中嵌入的静态物体的语义知识来改进可供性学习,有效地弥合了物体与动作之间的差距。大量实验表明,所提出模型的性能相比现有方法取得了突破性提升。我们的代码可在 https://github.com/woyut/WSAG-PLSP 获取。
引用
@article{arxiv.2505.24103,
title = {Weakly-Supervised Affordance Grounding Guided by Part-Level Semantic Priors},
author = {Peiran Xu and Yadong Mu},
journal= {arXiv preprint arXiv:2505.24103},
year = {2025}
}
备注
ICLR 2025