中文

OmniD:基于图像的 BEV 表示的通用机器人操纵策略

高能物理 - 唯象学 2025-08-19 v1 核实验 核理论

摘要

视觉马达策略容易过拟合到训练数据集中,如固定摄像位置和背景。这种过拟合导致该策略在分布内场景中表现良好,但在分布外泛化场景中表现不佳。此外,现有方法也难以融合多视角信息以生成有效的 3D 表示。为解决这些问题,我们提出了 Omni-Vision Diffusion Policy (OmniD),一个多视角融合框架,将图像观察合成统一的鸟瞰图 (BEV) 表示。我们引入基于可变形注意力的 Omni-Feature Generator (OFG),以选择性抽象任务相关特征,同时抑制视角特定噪声和背景干扰。OmniD 在分布内、分布外和 few-shot 实验中分别相对于最佳基线模型实现了 11%、17% 和 84% 的平均提升。训练代码和仿真基准已公开:https://github.com/1mather/omnid.git。

关键词

引用

@article{arxiv.2508.11897,
  title  = {Simulation of heavy quarkonium equilibration in the quark-gluon plasma},
  author = {Shouxing Zhao and Min He},
  journal= {arXiv preprint arXiv:2508.11897},
  year   = {2025}
}

备注

14 pages, 7 figures