中文

结合互补深度与语义提示的资源高效可供性定位

计算机视觉与模式识别 2025-07-22 v2 机器人学 图像与视频处理

摘要

可供性是指智能体从其环境中感知并利用的功能属性,是机器人执行动作所需的关键感知信息。该信息本质上是丰富且多模态的。现有的多模态可供性方法在提取有用信息方面面临局限,主要由于简单的结构设计、基础的融合方法以及庞大的模型参数,使其难以满足实际部署的性能要求。为了解决这些问题,本文提出了 BiT-Align 图像-深度-文本可供性映射框架。该框架包含旁路提示模块(BPM)和文本特征引导(TFG)注意力选择机制。BPM 将辅助模态深度图像直接作为主模态 RGB 图像的提示,在不引入额外编码器的情况下将其嵌入到主模态编码器中。这减少了模型的参数量,并有效提高了功能区域定位的准确性。TFG 机制利用文本特征引导图像编码器中注意力头的选择与增强,改善了对可供性特征的理解。实验结果表明,所提方法在公开的 AGD20K 和 HICO-IIF 数据集上取得了显著的性能提升。在 AGD20K 数据集上,与当前 SOTA 方法相比,我们在 KLD 指标上取得了 6.0% 的提升,同时将模型参数减少了 88.8%,展现了实际应用价值。源代码将在 https://github.com/DAWDSE/BiT-Align 公开。

关键词

引用

@article{arxiv.2503.02600,
  title  = {Resource-Efficient Affordance Grounding with Complementary Depth and Semantic Prompts},
  author = {Yizhou Huang and Fan Yang and Guoliang Zhu and Gen Li and Hao Shi and Yukun Zuo and Wenrui Chen and Zhiyong Li and Kailun Yang},
  journal= {arXiv preprint arXiv:2503.02600},
  year   = {2025}
}

备注

Accepted to IROS 2025. The source code will be made publicly available at https://github.com/DAWDSE/BiT-Align