中文

视觉几何协作指导下的可获得性学习

计算机视觉与模式识别 2024-10-16 v1

摘要

感知图像中"行动可能性"(即,可获得性)区域并从人类演示中学习对象交互功能是一项具有挑战性的任务,由于人类-对象交互的多样性。先前的可获得性学习算法通常采用标签分配范式,假设功能区域与可获得性标签之间存在唯一关系,导致在面对大量外观变化的未见环境时表现不佳。在本文中,我们提出利用交互亲和力进行可获得性学习,即从人类-对象交互中提取交互亲和力并将其传递给非交互式对象。交互亲和力代表了人体不同部位与目标对象局部区域之间的接触,可以提供人类与对象之间内在的可连接性线索,从而减少感知行动可能性的歧义。为此,我们提出了一种视觉-几何协作指导的可获得性学习网络,融合视觉和几何线索,联合从人类-对象交互中挖掘交互亲和力。此外,构建了一个由收集和标注超过55,047张图像构成的contact驱动可获得性学习(CAL)数据集。实验结果表明,我们的方法在客观指标和视觉质量方面均优于代表性模型。项目:https://github.com/lhc1224/VCR-Net

关键词

引用

@article{arxiv.2410.11363,
  title  = {Visual-Geometric Collaborative Guidance for Affordance Learning},
  author = {Hongchen Luo and Wei Zhai and Jiao Wang and Yang Cao and Zheng-Jun Zha},
  journal= {arXiv preprint arXiv:2410.11363},
  year   = {2024}
}