OpenHuman4D: 开放词汇表 4D 人体解析
计算机视觉与模式识别
2025-07-29 v2
摘要
理解动态 3D 人体表示在虚拟和扩展现实应用中日益重要。然而,现有的human part 分割方法受限于依赖封闭数据集和推理时间较长,这显著限制了其适用性。本文引入了第一个能够同时解决这些挑战的 4D 人体解析框架,通过减少推理时间并引入开放词汇表功能。建立在最先进的开放词汇表 3D 人体解析技术基础上,我们的方法扩展了对 4D 人体导向视频的支持,包含三个关键创新:1) 我们采用基于掩码的视频对象跟踪来高效建立空间和时间对应关系,避免对所有帧进行分割。2) 设计了新的掩码验证模块,用于管理新目标识别并缓解跟踪失败。3) 我们提出了 4D 掩码融合模块,集成记忆条件注意力和 logits 均衡,以实现稳健的嵌入融合。大量实验表明,所提方法在 4D 人体解析任务中有效且灵活,实现了最新方法(该方法仅限于解析固定类别)的最高 93.3% 加速。
引用
@article{arxiv.2507.09880,
title = {OpenHuman4D: Open-Vocabulary 4D Human Parsing},
author = {Keito Suzuki and Bang Du and Runfa Blark Li and Kunyao Chen and Lei Wang and Peng Liu and Ning Bi and Truong Nguyen},
journal= {arXiv preprint arXiv:2507.09880},
year = {2025}
}
备注
BMVC 2025