中文

TextAug:面向多模态行人重识别的测试时文本增强

计算机视觉与模式识别 2023-12-05 v1 机器学习

摘要

多模态行人重识别由于相比单模态框架具有更高的有效性,正受到研究社区的广泛关注。然而,多模态深度学习的瓶颈在于需要大量多模态训练样本。裁剪、翻转、旋转等数据增强技术常被用于图像领域,以提升深度学习模型的泛化能力。在图像以外的其他模态(如文本)上进行增强则具有挑战性,且需要大量计算资源与外部数据源。在本研究中,我们考察了两种计算机视觉数据增强技术——cutout 与 cutmix——在多模态行人重识别中文本增强的有效性。我们的方法将这两种增强策略融合为一种称为 CutMixOut 的策略,它以一定概率随机从句子中删除单词或子短语(cutout),并将两个或多个句子的部分混合以生成多样化样本(cutmix)。该增强在推理时实现,无需任何预先训练。我们的结果表明,所提技术简单而有效,能够在多个多模态行人重识别基准上提升性能。

关键词

引用

@article{arxiv.2312.01605,
  title  = {TextAug: Test time Text Augmentation for Multimodal Person Re-identification},
  author = {Mulham Fawakherji and Eduard Vazquez and Pasquale Giampa and Binod Bhattarai},
  journal= {arXiv preprint arXiv:2312.01605},
  year   = {2023}
}

备注

10 pages, 5 figures