用于弱监督 affordance 对齐的闭环迁移
计算机视觉与模式识别
2025-10-21 v1
摘要
人类能够通过观察他人与新颖物体的互动,即可执行此前未经验的交互。弱监督 affordance 对齐通过学习在基于观察者视角的图像上定位可执行动作的物体区域,模拟了这一过程。然而,仅从基于交互者视角的图像中提取 affordance 知识,并单向迁移到基于观察者视角的图像,限制了以往方法在复杂交互情景中的适用性。本研究引入 LoopTrans,一种新型闭环框架,不仅将知识从基于交互者视角的图像迁移到基于观察者视角的图像,还反向迁移以增强基于交互者视角的知识提取。在 LoopTrans 中,引入了统一的跨模态定位和去噪知识蒸馏等若干创新机制,以弥合以物体为中心的基于观察者视角图像与以交互为中心的基于交互者视角图像之间的领域差距,同时提升知识迁移效果。实验表明,LoopTrans 在图像和视频基准测试的所有指标上均实现了一致的改进,甚至能处理基于观察者身体遮挡完全遮蔽物体交互区域的极具挑战性的情景。
引用
@article{arxiv.2510.17384,
title = {Closed-Loop Transfer for Weakly-supervised Affordance Grounding},
author = {Jiajin Tang and Zhengxuan Wei and Ge Zheng and Sibei Yang},
journal= {arXiv preprint arXiv:2510.17384},
year = {2025}
}
备注
Accepted at ICCV 2025