中文

LEMMA:用于学习多智能体多任务活动的多视角数据集

计算机视觉与模式识别 2020-08-03 v1

摘要

理解与解释人类动作是人工智能中一项长期挑战,也是感知能力的关键指标。然而,先前文献在很大程度上遗漏了日常人类活动的若干关键组成部分,包括目标导向动作、并发多任务以及多智能体间的协作。我们引入 LEMMA 数据集,以精心设计的设定为这些缺失维度提供统一归属,其中任务与智能体数量可变以凸显不同学习目标。我们密集标注了带有人-物交互的原子动作,以提供日常活动的组合性、调度与分配的 ground-truth。我们进一步设计了具有挑战性的组合动作识别与动作/任务预期基准及基线模型,以衡量组合动作理解与时序推理能力。我们希望这一努力能推动机器视觉社区审视目标导向人类活动,并进一步研究真实世界中的任务调度与分配。

关键词

引用

@article{arxiv.2007.15781,
  title  = {LEMMA: A Multi-view Dataset for Learning Multi-agent Multi-task Activities},
  author = {Baoxiong Jia and Yixin Chen and Siyuan Huang and Yixin Zhu and Song-chun Zhu},
  journal= {arXiv preprint arXiv:2007.15781},
  year   = {2020}
}