从演示视频到目标图像的可用性定位
计算机视觉与模式识别
2023-03-28 v1
摘要
人类擅长从专家演示中学习并解决自身问题。为使智能机器人与助手(如AR眼镜)具备此能力,需从演示视频中定位人类手部交互(即可用性)并应用于目标图像(如用户的AR眼镜视图)。视频到图像的可用性定位任务具有挑战性,原因在于(1)需预测细粒度可用性,(2)训练数据有限,未能充分覆盖视频-图像差异并对定位产生负面影响。为应对这些,我们提出Affordance Transformer(Afformer),其具有基于细粒度transformer的解码器,可逐步精炼可用性定位。此外,我们引入Mask Affordance Hand(MaskAHand),一种自监督预训练技术,用于合成视频-图像数据并模拟上下文变化,以增强跨视频-图像差异的可用性定位。采用MaskAHand预训练的Afformer在多个基准上取得最先进性能,包括在OPRA数据集上显著提升37%。代码见https://github.com/showlab/afformer。
引用
@article{arxiv.2303.14644,
title = {Affordance Grounding from Demonstration Video to Target Image},
author = {Joya Chen and Difei Gao and Kevin Qinghong Lin and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2303.14644},
year = {2023}
}
备注
CVPR 2023