从孤岛到泛大陆:统一人类动作理解的语义空间
计算机视觉与模式识别
2024-04-04 v4 人工智能
机器学习
摘要
动作理解长期受到关注。它可形成为从物理空间到语义空间的映射。典型地,研究者根据各自特定的选择来构建数据集以定义类别,并分别推进基准的上限。由于语义鸿沟和各种类别粒度,数据集彼此不兼容,如同“孤岛”,例如数据集 A 中的做家务和数据集 B 中的洗盘子。我们认为,我们需要一个更有原则的语义空间来凝聚社区力量,并联合使用所有数据集以追求可泛化的动作学习。为此,我们设计了一个结构化的动作语义空间,给定动词分类层级并覆盖大量动作。通过将先前数据集的类别对齐到我们的语义空间,我们将(图像/视频/骨架/动作捕捉)数据集聚集为一个统一标签系统中的统一数据库,即把“孤岛”桥接为“泛大陆”。相应地,我们提出了一种从物理空间到语义空间的新模型以充分利用泛大陆。在大量实验中,我们的新系统显示出显著优越性,尤其在迁移学习中。我们的代码和数据将公开于 https://mvig-rhos.com/pangea。
引用
@article{arxiv.2304.00553,
title = {From Isolated Islands to Pangea: Unifying Semantic Space for Human Action Understanding},
author = {Yong-Lu Li and Xiaoqian Wu and Xinpeng Liu and Zehao Wang and Yiming Dou and Yikun Ji and Junyi Zhang and Yixing Li and Jingru Tan and Xudong Lu and Cewu Lu},
journal= {arXiv preprint arXiv:2304.00553},
year = {2024}
}
备注
CVPR 2024, Project Webpage: https://mvig-rhos.com/pangea