基于超四形态的从 egocentric RGB 视频实现 3D 手-物体重建与组合动作识别的协同学习
计算机视觉与模式识别
2025-01-14 v1 人工智能
摘要
随着 egocentric 3D 手-物体交互数据集的不断涌现,越来越多的人关注开发统一模型用于手-物体姿态估计和动作识别。然而,现有方法仍然难以识别在未见物体上的 seen 动作,因为使用 3D 边界框来表示物体形状和运动存在局限。此外,依赖测试时物体模板的方法也限制了其对未见物体的可泛化性。为此,我们提出利用超四形态作为替代性 3D 物体表示来替代边界框,并在模板-free 物体重建和动作识别任务上展示其有效性。此外,我们发现纯基于外观的方法在统一方法中性能更好,3D 几何信息的潜在益处尚不明确。因此,我们考虑更具挑战性的任务,即训练时动词和名词的组合与测试集不重叠。我们扩展 H2O 和 FPHA 数据集,加入组合划分,并设计一种新颖的协同学习框架,以显式推理手部与被操作物体之间的几何关系。通过大量定性和定量评估,我们在(组合)动作识别方面显著优于现有方法。
引用
@article{arxiv.2501.07100,
title = {Collaborative Learning for 3D Hand-Object Reconstruction and Compositional Action Recognition from Egocentric RGB Videos Using Superquadrics},
author = {Tze Ho Elden Tse and Runyang Feng and Linfang Zheng and Jiho Park and Yixing Gao and Jihie Kim and Ales Leonardis and Hyung Jin Chang},
journal= {arXiv preprint arXiv:2501.07100},
year = {2025}
}
备注
Accepted to AAAI 2025