中文

通过动态路径定制进行图像描述

计算机视觉与模式识别 2024-06-04 v1

摘要

本文探索了一种用于视觉和语言任务的新型动态网络,其中推理结构针对不同输入动态定制。大多数先前的最先进方法是静态且手工设计的网络,这不仅严重依赖专家知识,而且忽略了输入样本的语义多样性,因此导致次优性能。为了解决这些问题,我们提出了一种用于图像描述的新型动态 Transformer 网络 (DTNet),该网络动态地为不同样本分配定制路径,从而产生具有判别性且准确的描述。具体来说,为了构建丰富的路由空间并提高路由效率,我们引入了五种基本单元,并根据它们的操作域(即空间和通道)将它们分组到两个独立的路由空间中。然后,我们设计了一个空间-通道联合路由器 (SCJR),它使模型能够基于输入样本的空间和通道信息进行路径定制。为了验证我们提出的 DTNet 的有效性,我们在 MS-COCO 数据集上进行了大量实验,并在 Karpathy 分割和在线测试服务器上取得了新的最先进性能。

关键词

引用

@article{arxiv.2406.00334,
  title  = {Image Captioning via Dynamic Path Customization},
  author = {Yiwei Ma and Jiayi Ji and Xiaoshuai Sun and Yiyi Zhou and Xiaopeng Hong and Yongjian Wu and Rongrong Ji},
  journal= {arXiv preprint arXiv:2406.00334},
  year   = {2024}
}

备注

TNNLS24