Hulk:面向以人为中心任务的通用知识翻译器
计算机视觉与模式识别
2025-08-07 v5 人工智能
摘要
以人为中心的感知任务,例如行人检测、基于骨架的动作识别与姿态估计,拥有广泛的工业应用,如元宇宙与体育分析。近期涌现了开发以人为中心基础模型的热潮,此类模型可惠及广泛的以人为中心感知任务。尽管许多以人为中心基础模型已取得成效,它们并未探索以人为中心的3D与视觉语言任务,且需要任务特定的微调。这些局限限制了其在更多下游任务与场景中的应用。为应对这些问题,我们提出Hulk,首个多模态以人为中心通用模型,能够处理2D视觉、3D视觉、基于骨架及视觉语言任务,且无需任务特定微调。实现此目标的关键是将各类任务特定头压缩为两个通用头,一个用于离散表示(如语言),另一个用于连续表示(如位置坐标)。两头的输出可进一步堆叠为四种不同的输入与输出模态。这种统一表示使Hulk将多样的以人为中心任务视为模态翻译,整合跨广泛任务的知识。在覆盖8项以人为中心任务、12个基准上对Hulk的全面评估证明了我们所提方法的优越性,在11个基准上取得了最先进性能。代码将发布于 https://github.com/OpenGVLab/Hulk。
引用
@article{arxiv.2312.01697,
title = {Hulk: A Universal Knowledge Translator for Human-Centric Tasks},
author = {Yizhou Wang and Yixuan Wu and Weizhen He and Xun Guo and Feng Zhu and Lei Bai and Rui Zhao and Jian Wu and Tong He and Wanli Ouyang and Shixiang Tang},
journal= {arXiv preprint arXiv:2312.01697},
year = {2025}
}
备注
Accepted by TPAMI2025