HGGT:从未校准图像重建鲁棒且灵活的 3D 手部网格
密码学与安全
2026-03-26 v1
摘要
从图像中恢复高保真度 3D 手部几何是计算机视觉中的关键任务,对于机器人、动画和 VR/AR 等领域具有重大价值。关键在于,可扩展的应用要求具备准确性和部署灵活性,需能够利用来自互联网或无校准消费级 RGB 摄像机的大量非结构化图像数据,而无需复杂校准。然而,当前方法面临困境。虽然单视角方法易于部署,但 suffer from 深度歧义和遮挡;相反,多视角系统能解决这些不确定性,但通常需要固定、校准的设置,限制了实际实用性。为填补这一差距,我们借鉴从视觉数据中直接学习显式几何的 3D 基础模型。通过将从任意视角重建手部几何重新表述为视觉-几何 grounding 任务,我们提出一种 feed-forward 架构,首次在文献中联合从未校准视角中推断 3D 手部网格和相机姿态。广泛的评估表明,我们的方法在超越最先进基准的同时,对未校准、野生场景具有强大的泛化能力。项目页面链接:https://lym29.github.io/HGGT/。
引用
@article{arxiv.2603.23996,
title = {Forensic Implications of Localized AI: Artifact Analysis of Ollama, LM Studio, and llama.cpp},
author = {Shariq Murtuza},
journal= {arXiv preprint arXiv:2603.23996},
year = {2026}
}