中文

DMAT: 用于人体去遮挡的动态掩码感知 Transformer

计算机视觉与模式识别 2024-02-08 v1

摘要

人体去遮挡旨在从被遮挡的图像中推断不可见人体部分的外观,在行人重识别和意图推断等许多与人相关的任务中具有重要价值。为了解决这一任务,本文提出了一种动态掩码感知 Transformer(DMAT),它可以动态增强来自人体区域的信息并削弱来自遮挡区域的信息。首先,为了增强 token 表示,我们设计了一个带有增大卷积核的扩展卷积头,以捕获更多有效的局部上下文并减轻周围遮挡的影响。为了专注于可见的人体部分,我们通过整合多个掩码,提出了一种新颖的动态多头人体掩码引导注意力机制,该机制可以防止去遮挡区域同化到背景中。此外,利用区域上采样策略来减轻遮挡对插值图像的影响。在模型学习过程中,开发了非模态损失以进一步强调人体区域的恢复效果,这也改善了模型的收敛性。在 AHP 数据集上的大量实验表明,与最近的最先进方法相比,该方法具有优越的性能。

关键词

引用

@article{arxiv.2402.04558,
  title  = {DMAT: A Dynamic Mask-Aware Transformer for Human De-occlusion},
  author = {Guoqiang Liang and Jiahao Hu and Qingyue Wang and Shizhou Zhang},
  journal= {arXiv preprint arXiv:2402.04558},
  year   = {2024}
}