HAMMER:利用跨模态集成激发多模态大语言模型以意图驱动进行 3D 形态 grounding
计算机视觉与模式识别
2026-03-04 v1
摘要
人类通常通过观察图像或视频中表现出的交互来识别 3D 物体的形态感知。一旦形成,这类知识即可被泛化到新物体。以此为灵感,我们提出一种新框架,利用新兴的多模态大语言模型(MLLMs)进行以交互意图为驱动的 3D 形态感知 grounding,称为 HAMMER。我们不生成明确的物体属性描述,也不依赖即插即用的 2D 分割器,而是将图像中表现的交互意图聚合为一种具有接触感知的嵌入向量,并引导模型推断文本形态标签,从而充分挖掘物体语义和上下文线索。我们进一步设计了层次化跨模态集成机制,充分利用 MLLM 为 3D 表示 refinement 提供互补信息,并引入一种多粒度几何提升模块,将空间特征注入提取的意图嵌入,从而促进准确的 3D 形态 localization。在公开数据集和我们新构建的损坏基准上进行的大量实验表明,HAMMER 在性能和鲁棒性方面均优于现有方法。所有代码和模型权重均已公开可用。
引用
@article{arxiv.2603.02329,
title = {HAMMER: Harnessing MLLM via Cross-Modal Integration for Intention-Driven 3D Affordance Grounding},
author = {Lei Yao and Yong Chen and Yuejiao Su and Yi Wang and Moyun Liu and Lap-Pui Chau},
journal= {arXiv preprint arXiv:2603.02329},
year = {2026}
}
备注
Accepted by CVPR 2026. Project Page: https://rayyoh.github.io/Hammer