OVSegDT:用于开放词汇目标导航的对象分割变换器
机器人学
2026-03-31 v3
摘要
开放词汇目标导航要求具身智能体到达由自由形式语言描述的对象,包括训练期间未见过的类别。现有端到端策略过拟合小型模拟器数据集,在训练场景上取得高成功率,但难以泛化,表现不稳定(频繁碰撞)。我们引入 OVSegdt,一种轻量级变换器策略,通过两个协同组件解决上述问题。第一个组件是语义分支,包括用于目标二值掩码的编码器和辅助分割损失函数,使文本目标获得 grounding 并提供精确的空间线索。第二个组件是提出的熵自适应损失调制(Entropy-Adaptive Loss Modulation),一种按样本调度器,根据策略熵持续平衡模仿和强化信号,消除脆弱的手动阶段切换。这些添加使训练样本复杂度降低 33%,碰撞次数减少一半,同时保持低推理成本(1300 万参数,仅使用 RGB 输入)。在 HM3D-OVON 上,我们的模型在未见类别上的性能与训练时类别相当,并在无深度、惯性里程计或大型视觉语言模型的情况下达到最先进结果(val unseen 上的 SR 40.1%,SPL 20.9%)。代码已公开 https://github.com/CognitiveAISystems/OVSegDT。
引用
@article{arxiv.2508.11479,
title = {OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation},
author = {Tatiana Zemskova and Aleksei Staroverov and Dmitry Yudin and Aleksandr Panov},
journal= {arXiv preprint arXiv:2508.11479},
year = {2026}
}