EA3D:从流式视频中实现在线开放世界3D目标提取
计算机视觉与模式识别
2025-10-30 v1
摘要
当前3D场景理解方法受限于离线收集的多视角数据或预构建的3D几何。本文提出ExtractAnything3D(EA3D),一个统一的在线框架,用于开放世界3D目标提取,使能够同时进行几何重建和整体场景理解。给定流式视频,EA3D动态使用视觉语言和2D视觉基础编码器来解释每个帧,从而提取目标级别知识。该知识通过前馆在线更新策略集成并嵌入到高斯特征图中。我们随后迭代从历史帧中估计视觉里程计,并与新观察持续更新在线高斯特征。一个循环联合优化模块引导模型注意力聚焦于感兴趣区域,同时增强几何重建和语义理解。广泛实验包括照片逼真渲染、语义和实例分割、3D边界框和语义占据估计以及3D网格生成,都显示EA3D有效。我们的方法建立了统一且高效的框架,用于联合在线3D重建和整体场景理解,使下游任务得以实现。
引用
@article{arxiv.2510.25146,
title = {EA3D: Online Open-World 3D Object Extraction from Streaming Videos},
author = {Xiaoyu Zhou and Jingqi Wang and Yuang Jia and Yongtao Wang and Deqing Sun and Ming-Hsuan Yang},
journal= {arXiv preprint arXiv:2510.25146},
year = {2025}
}
备注
The Thirty-Ninth Annual Conference on Neural Information Processing Systems(NeurIPS 2025)