以人为中心的基础模型:感知、生成与智能体建模
计算机视觉与模式识别
2025-02-13 v1 人工智能
机器学习
多媒体
摘要
人类理解与生成对于建模数字人类和人类具身 embodiment 至关重要。近期,受通用模型(如大型语言和视觉模型)成功的启发,以人为中心的基础模型(Human-centric Foundation Models, HcFMs)涌现出来,将多样化的人类中心任务统一到单一框架中,超越了传统的任务特定方法。在本综述中,我们通过提出一个分类法对 HcFMs 的当前方法进行全面概述,将其分为四组:(1)以人为中心的感知基础模型,捕捉细粒度特征以实现多模态 2D 和 3D 理解;(2)以人为中心的 AIGC 基础模型,生成高保真、多样化的人类相关内容;(3)统一感知与生成模型,整合这些能力以增强人类理解与合成;(4)以人为中心的智能体基础模型,超越感知与生成,学习类人智能和交互行为以实现人类具身任务。我们综述了最先进的技术,讨论了新兴挑战和未来研究方向。本综述旨在为从事更稳健、通用和智能的数字人类与具身建模的研究人员和从业者提供路线图。
引用
@article{arxiv.2502.08556,
title = {Human-Centric Foundation Models: Perception, Generation and Agentic Modeling},
author = {Shixiang Tang and Yizhou Wang and Lu Chen and Yuan Wang and Sida Peng and Dan Xu and Wanli Ouyang},
journal= {arXiv preprint arXiv:2502.08556},
year = {2025}
}
备注
9 pages