中文

基于多任务自适应学习和跨维特征引导的高效RGB-D场景理解

计算机视觉与模式识别 2026-03-10 v1

摘要

场景理解在实现机器人系统智能与自主性方面发挥着关键作用。传统方法常面临遮挡、边界模糊以及无法根据任务特定需求和样本变化调整注意力等挑战。为此,本文提出了一种高效的RGB-D场景理解模型,完成语义分割、实例分割、姿态估计、全景分割和场景分类等多项任务。该模型包含增强的融合编码器,有效利用RGB和深度输入的冗余信息。针对语义分割,本文引入归一化注意力通道层和上下文特征交互层,以缓解浅层特征误导和局部-全局特征表示不足的问题。实例分割任务受益于非瓶颈1D结构,该结构以更少的参数实现更佳的轮廓表征。此外,本文提出一种多任务自适应损失函数,根据场景变化动态调整不同任务的学习策略。在NYUv2、SUN RGB-D和Cityscapes数据集上的大量实验表明,我们的方法在分割精度和处理速度方面均优于现有方法。

关键词

引用

@article{arxiv.2603.07570,
  title  = {Efficient RGB-D Scene Understanding via Multi-task Adaptive Learning and Cross-dimensional Feature Guidance},
  author = {Guodong Sun and Junjie Liu and Gaoyang Zhang and Bo Wu and Yang Zhang},
  journal= {arXiv preprint arXiv:2603.07570},
  year   = {2026}
}

备注

23 pages, 13 figures