HA-ViD:面向装配知识全面理解的人体装配视频数据集
计算机视觉与模式识别
2023-07-13 v1
摘要
从视频中理解全面的装配知识对未来超智能工业至关重要。为实现技术突破,我们提出 HA-ViD——首个具有代表性工业装配场景、自然过程性知识获取流程以及一致的人机共享标注的人体装配视频数据集。具体而言,HA-ViD 捕捉真实装配中的多样协作模式、装配过程中自然的人类行为与学习进展,并将动作标注细化为主体、动作动词、被操作对象、目标对象和工具。我们提供 3222 段多视角、多模态视频(每段视频包含一个装配任务)、1.5M 帧、96K 时间标签和 2M 空间标签。我们对四项基础视频理解任务进行基准测试:动作识别、动作分割、目标检测和多目标跟踪。重要的是,我们分析了它们在理解装配进度、过程效率、任务协作、技能参数和人类意图方面的性能。HA-ViD 的详细信息见:https://iai-hrc.github.io/ha-vid。
引用
@article{arxiv.2307.05721,
title = {HA-ViD: A Human Assembly Video Dataset for Comprehensive Assembly Knowledge Understanding},
author = {Hao Zheng and Regina Lee and Yuqian Lu},
journal= {arXiv preprint arXiv:2307.05721},
year = {2023}
}