MMHU:面向人类行为理解的大规模多模态基准
计算机视觉与模式识别
2025-07-17 v1
摘要
人类是交通系统的重要组成部分,理解他们的行为对于促进安全驾驶系统的开发至关重要。尽管最近的进展探索了人类行为的 various aspects——例如运动、轨迹和意图——但尚无用于评估 autonomous driving 中人类行为理解的综合基准。在本 work 中,我们提出 ,一个大规模的人类行为分析基准,具有丰富的注释,包括人类运动和轨迹、人类运动的文本描述、人类意图以及与驾驶安全相关的关键行为标签。该数据集涵盖 57k 人类运动 clip 和 1.73M frame,来自多种来源,包括 established driving 数据集如 Waymo、来自 YouTube 的野生视频以及自采集数据。我们开发了人类 in-the-loop annotation pipeline 来生成丰富的行为描述。我们提供了详尽的数据集分析并对 multiple tasks 进行基准测试——从运动预测到运动生成和人类行为 question answering——从而提供了广泛的评估套件。项目页面:https://MMHU-Benchmark.github.io。
引用
@article{arxiv.2507.12463,
title = {MMHU: A Massive-Scale Multimodal Benchmark for Human Behavior Understanding},
author = {Renjie Li and Ruijie Ye and Mingyang Wu and Hao Frank Yang and Zhiwen Fan and Hezhen Hu and Zhengzhong Tu},
journal= {arXiv preprint arXiv:2507.12463},
year = {2025}
}