ViewActive:基于单张图像的主动视点优化
机器人学
2025-07-29 v5
摘要
在观察物体时,人类凭借空间可视化和心理旋转能力,能够基于当前观察构想出潜在的最优视点。这种能力对于使机器人在运行过程中实现高效且鲁棒的场景感知至关重要,因为最优视点提供了准确表征 2D 图像中场景的必要且信息丰富的特征,从而增强下游任务。为了赋予机器人这种类人的主动视点优化能力,我们提出了 ViewActive,一种受外观图启发的现代机器学习方法,它仅基于当前 2D 图像输入提供视点优化指导。具体而言,我们引入了 3D 视点质量场,这是一种类似于外观图的紧凑且一致的视点质量分布表示,由三个通用视点质量指标组成:自遮挡率、感知占用的表面法线熵和视觉熵。我们利用预训练的图像编码器提取鲁棒的视觉和语义特征,随后将其解码为 3D VQF,使得我们的模型能够有效泛化到包括未见类别在内的多种物体。轻量级的 ViewActive 网络(在单张 GPU 上 72 FPS)显著增强了最先进的物体识别流程的性能,并可集成到机器人应用的实时运动规划中。我们的代码和数据集可在以下网址获取:https://github.com/jiayi-wu-umd/ViewActive。
引用
@article{arxiv.2409.09997,
title = {ViewActive: Active viewpoint optimization from a single image},
author = {Jiayi Wu and Xiaomin Lin and Botao He and Cornelia Fermuller and Yiannis Aloimonos},
journal= {arXiv preprint arXiv:2409.09997},
year = {2025}
}