中文

大规模多模态数据集与基准用于人类活动场景理解与推理

计算机视觉与模式识别 2025-12-09 v1 人工智能

摘要

多模态人类动作识别(HAR)利用互补传感器进行活动分类。除识别外,近期大型语言模型(LLM)的进展促进了详细描述和因果推理,催生了新的任务:人类动作理解(HAU)和人类动作推理(HARn)。然而,大多数大型语言模型,尤其是大型视觉语言模型(LVLMs),因缺乏大规模数据-标注资源,难以处理深度、IMU 和毫米波等非 RGB 模态。现有 HAR 数据集主要提供粗糙的数据-标签标注,无法捕捉 HAU 和 HARn 所需的细粒度动作动态。我们考虑两种真实配对类型:(1)数据标签(离散类别)和(2)数据标注(文本描述)。 naively 从标签生成标注往往缺乏逻辑性和时空一致性。我们引入 CUHK-X,一个大规模多模态数据集与基准测试套件,用于 HAR、HAU 和 HARn。CUHK-X 包含 58,445 个样本,覆盖 40 项活动,涉及 30 名参与者在两个室内环境中的活动。为提高标注一致性,我们提出了一种基于提示的场景创建方法,利用 LLM 生成逻辑连贯的活动序列,并进行人工验证。CUHK-X 包括三个基准测试,涵盖六个评估任务。实验报告了 HAU、HAU 和 HARn 的平均准确率分别为 76.52%、40.76% 和 70.25%。CUHK-X 旨在为社区提供数据密集型学习方法,以实现稳健的多模态人类活动分析。项目页面和代码:https://openaiotlab.github.io/CUHK-X/ 和 https://github.com/openaiotlab/CUHK-X。

关键词

引用

@article{arxiv.2512.07136,
  title  = {A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning},
  author = {Siyang Jiang and Mu Yuan and Xiang Ji and Bufang Yang and Zeyu Liu and Lilin Xu and Yang Li and Yuting He and Liran Dong and Wenrui Lu and Zhenyu Yan and Xiaofan Jiang and Wei Gao and Hongkai Chen and Guoliang Xing},
  journal= {arXiv preprint arXiv:2512.07136},
  year   = {2025}
}