中文

Human-in-Context:基于 In-Context Learning 的统一跨域 3D 人体运动建模

计算机视觉与模式识别 2025-08-15 v1

摘要

本文旨在构建能够跨域处理 3D 人体运动的模型,期望该模型能够处理多种模态、任务和数据集。现有的跨域模型往往依赖于领域特定组件和多阶段训练,这限制了其实际可行性和可扩展性。为克服这些挑战,我们提出了一种通过单一过程训练统一跨域模型的新方案,无需领域特定组件和多阶段训练。我们首先引入 Pose-in-Context(PiC),利用 In-Context Learning 创建一个基于姿态的跨域模型。虽然 PiC 能在多个基于姿态的任务和数据集之间取得较好的泛化,但它在处理模态多样性、策略选择和上下文依赖方面存在困难。因此,我们提出了 Human-in-Context(HiC),这是一种对 PiC 的扩展,旨在实现对模态、任务和数据集的更广泛泛化。HiC 将姿态和网格表示整合到统一框架中,扩大了任务覆盖范围,并纳入更大规模的数据集。此外,HiC 引入了最大-最小相似度提示采样策略,以增强跨不同域的泛化,并采用带有双分支上下文注入的网络架构,以 improved handling of contextual dependencies。大量实验结果表明,HiC 在泛化性、数据规模和性能方面均优于 PiC,在广泛的领域范围内表现更好。这表明了 HiC 在构建具备更好灵活性和可扩展性的统一跨域 3D 人体运动模型方面的潜力。源代码和模型已 disponible at https://github.com/BradleyWang0416/Human-in-Context。

关键词

引用

@article{arxiv.2508.10897,
  title  = {Human-in-Context: Unified Cross-Domain 3D Human Motion Modeling via In-Context Learning},
  author = {Mengyuan Liu and Xinshun Wang and Zhongbin Fang and Deheng Ye and Xia Li and Tao Tang and Songtao Wu and Xiangtai Li and Ming-Hsuan Yang},
  journal= {arXiv preprint arXiv:2508.10897},
  year   = {2025}
}