中文

DISCO: 通过可微场景语义和双层控制实现具身导航与交互

计算机视觉与模式识别 2025-03-24 v1

摘要

通过人类命令构建擅长于多样化任务的通用智能家居助理代理是具身AI研究的长期蓝图,对任务规划、环境建模和对象交互提出了要求。在本工作中,我们研究原始移动操作的具身代理,即如何基于指示的动词-名词对进行导航和交互。我们提出了DISCO,其在场景建模和高效控制方面具有非平凡的进展。具体而言,DISCO融合了对象和affordance中丰富语义的可微场景表示,该表示在运行时动态学习并促进导航规划。此外,我们提出了基于全局和局部线索的双层粗到细动作控制,以高效完成移动操作任务。DISCO容易集成到具身任务中,如具身指令跟随。在充分的实验中,我们进行了全面评估,并表明DISCO在未见场景中以可观的+8.6%成功率优势超过当前技术,即使没有逐步指令亦可。我们的代码已公开发布于https://github.com/AllenXuuu/DISCO。

关键词

引用

@article{arxiv.2407.14757,
  title  = {Enhancing Skin Disease Classification Leveraging Transformer-based Deep Learning Architectures and Explainable AI},
  author = {Jayanth Mohan and Arrun Sivasubramanian and V Sowmya and Ravi Vinayakumar},
  journal= {arXiv preprint arXiv:2407.14757},
  year   = {2025}
}

备注

Submitted to Computers in Biology and Medicine