超越地球:理解微重力环境中的人类动作与场景
计算机视觉与模式识别
2026-03-24 v4
摘要
尽管在视频理解方面取得了实质性进展,但大多数现有数据集仅限于地球的重力条件。然而,微重力改变了人类运动、交互和视觉语义,揭示了现实世界视觉系统的关键空白。这对安全关键的太空应用中领域鲁棒的视频理解提出了挑战。为了解决这一问题,我们引入了 MicroG-4M,这是首个用于微重力下人类活动时空和语义理解的基准。该数据集由真实的太空任务和电影模拟构建,包含 4,759 个涵盖 50 种动作的视频片段、1,238 条富含上下文的描述,以及关于宇航员活动和场景理解的超过 7,000 个问答对。MicroG-4M 支持三项核心任务:细粒度多标签动作识别、时序视频描述和视觉问答,从而能够对微重力语境下的空间定位和语义推理进行全面评估。我们使用 SOTA 模型建立了基线。所有数据、标注和代码均可在 https://github.com/LEI-QI-233/HAR-in-Space 获取。
引用
@article{arxiv.2506.02845,
title = {Go Beyond Earth: Understanding Human Actions and Scenes in Microgravity Environments},
author = {Di Wen and Lei Qi and Kunyu Peng and Kailun Yang and Fei Teng and Ao Luo and Jia Fu and Yufan Chen and Ruiping Liu and Yitian Shi and M. Saquib Sarfraz and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2506.02845},
year = {2026}
}
备注
16 pages, 4 figures, code are available at https://github.com/LEI-QI-233/HAR-in-Space