Ask, Pose, Unite:面向人类网格估计近距离交互的大规模数据获取
计算机视觉与模式识别
2024-10-02 v1 人工智能
机器学习
摘要
近距离人类互动中的社会动力学为人类网格估计(HME)带来了重大挑战,尤其是由于物理接触的复杂性以及训练数据的稀缺性。为解决这些挑战,我们引入了一种新型数据生成方法,利用大型视觉语言模型(LVLMs)标注接触图谱,这些图谱指导测试时优化以产生配对的图像和伪真实网格。该方法不仅减轻了标注负担,也使我们能够为HME中的近距离交互构建专门的数据集。我们收集的 Ask Pose Unite (APU) 数据集包含超过 6200 对覆盖多样互动类型的人类网格对,数据来源于呈现自然化人物间场景的图像。我们经验性地表明,使用该数据集训练基于扩散的接触先验,可作为优化期间的指导,提高了对未见互动的网格估计精度。我们的工作解决了HME近距离交互数据稀缺的长期挑战,增强了该领域处理复杂互动情景的能力。
引用
@article{arxiv.2410.00309,
title = {Ask, Pose, Unite: Scaling Data Acquisition for Close Interactions with Vision Language Models},
author = {Laura Bravo-Sánchez and Jaewoo Heo and Zhenzhen Weng and Kuan-Chieh Wang and Serena Yeung-Levy},
journal= {arXiv preprint arXiv:2410.00309},
year = {2024}
}
备注
Project webpage: https://laubravo.github.io/apu_website/