中文

基于多模态大语言模型的无训练稠密手部接触估计

计算机视觉与模式识别 2026-05-08 v1

摘要

稠密手部接触估计需要高水平的语义理解和细粒度的几何推理,以准确定位接触区域。最近的多模态大语言模型(MLLM)在理解视觉语义方面表现出强大能力,这得益于从大规模数据中学习到的视觉语言先验。然而,如何利用MLLM进行稠密手部接触估计仍未得到充分探索。将MLLM应用于稠密手部接触估计存在两个主要挑战:首先,编码显式的3D手部几何困难,因为MLLM主要 operate 在视觉和语言模态上;其次,捕获细粒度的顶点级接触仍然具有挑战,因为MLLM倾向于关注高层次语义而非详细的几何推理。为了解决这些挑战,我们提出了 ContactPrompt,一种基于MLLM的无训练零样例稠密手部接触估计方法。为了有效地编码3D手部几何,我们引入了详细的手部部件分割和部件相关的顶点网格表示,提供结构化、局部化的几何信息。为了实现准确且高效的稠密接触预测,我们开发了具有部件条件的多阶段结构化接触推理,逐步构建全局语义与细粒度几何之间的联系。因此,我们的方法有效地利用了MLLM的推理能力,同时实现了精确的稠密手部接触估计。令人惊讶的是,所提出的方法在不要求任何训练的情况下,就超过了在大规模稠密接触数据集上训练的以前方法。我们将发布代码。

关键词

引用

@article{arxiv.2605.05886,
  title  = {Training-Free Dense Hand Contact Estimation with Multi-Modal Large Language Models},
  author = {Daniel Sungho Jung and Kyoung Mu Lee},
  journal= {arXiv preprint arXiv:2605.05886},
  year   = {2026}
}

备注

Project page: https://contactprompt-release.github.io/