UniFunc3D:面向3D功能分割的统一主动时空定位
计算机视觉与模式识别
2026-03-25 v1
摘要
3D场景中的功能分割要求智能体将隐式的自然语言指令定位到细粒度交互元素的精确掩码。现有方法依赖碎片化的管道,在初始任务解析阶段存在视觉盲区。我们观察到这些方法受限于单尺度、被动且启发式的帧选择。我们提出UniFunc3D,一个统一且无需训练的框架,将多模态大语言模型作为主动观察者。通过将语义、时空推理整合到单个前向传递中,UniFunc3D进行联合推理,将任务分解定位到直接的视觉证据中。我们的方法引入了以粗到细策略的主动时空定位。这使模型能够自适应选择正确的视频帧,聚焦于高细节的交互部分,同时保留必要的全局语境以实现消歧。实验表明,在SceneFun3D数据集上,UniFunc3D实现了最先进的性能,相较于无训练和有训练的方法以相对59.9%的mIoU提升显著优越,且无需任何任务特定训练。代码将在我们的项目页面发布:https://jiaying.link/unifunc3d。
引用
@article{arxiv.2603.23478,
title = {UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation},
author = {Jiaying Lin and Dan Xu},
journal= {arXiv preprint arXiv:2603.23478},
year = {2026}
}