中文

用于视频行人重识别的集合增强三元组损失

计算机视觉与模式识别 2020-11-10 v2

摘要

现代视频行人重识别(re-ID)机器通常使用度量学习方法训练,并由三元组损失监督。视频重识别中使用的三元组损失通常基于所谓的片段特征,每个片段特征由若干帧特征聚合而成。本文提出将视频片段建模为一个集合,并转而研究相应三元组损失中集合之间的距离。与片段表示之间的距离不同,片段集合之间的距离考虑了两个集合间每个元素(即帧表示)的成对相似性。这使得网络能够直接在帧级别优化特征表示。除常用的集合距离度量(如普通距离与豪斯多夫距离)外,我们进一步提出了一种专为集合感知三元组损失定制的混合距离度量。此外,我们提出了一种利用批次中学习到的类原型进行困难正样本集合构建的策略。我们提出的方法在多个标准基准上取得了最先进的结果,证明了该方法的优势。

关键词

引用

@article{arxiv.2011.00774,
  title  = {Set Augmented Triplet Loss for Video Person Re-Identification},
  author = {Pengfei Fang and Pan Ji and Lars Petersson and Mehrtash Harandi},
  journal= {arXiv preprint arXiv:2011.00774},
  year   = {2020}
}

备注

to appear in WACV 2021