利用集成与自监督学习实现全无监督行人重识别与文本作者归属
计算机视觉与模式识别
2023-07-03 v4
摘要
在多媒体取证问题中,如行人重识别与文本作者归属,从完全无标签数据中学习具有挑战性。近期自监督学习方法在处理底层类别具有显著语义差异(类内距离远小于类间距离)的完全无标签数据时已被证明有效。然而,对于取证应用而言并非如此,其中各类语义相似且训练集与测试集身份不相交。一般自监督学习方法在此场景下可能难以学习判别性特征,因此需要更鲁棒的策略。我们提出一种策略,通过即使在不同类别样本并非显著多样时也能从无标签数据中学习,来处理行人重识别与文本作者归属。我们提出一种新颖的基于集成的聚类策略,将不同配置得到的簇组合以全无监督方式生成更好的数据样本分组。该策略使得具有不同密度和更高可变性的簇得以涌现,减少了类内差异,而无需负担为每个数据集寻找最优配置。我们还考虑不同的卷积神经网络用于特征提取及随后的样本间距离计算。我们通过引入上下文并对其进行分组以捕获互补信息来精炼这些距离。我们的方法在两项任务及不同数据模态上均具鲁棒性,并以完全无监督方案(无任何标注或人工干预)优于当前最优方法。
引用
@article{arxiv.2202.03126,
title = {Leveraging Ensembles and Self-Supervised Learning for Fully-Unsupervised Person Re-Identification and Text Authorship Attribution},
author = {Gabriel Bertocco and Antônio Theophilo and Fernanda Andaló and Anderson Rocha},
journal= {arXiv preprint arXiv:2202.03126},
year = {2023}
}
备注
This work has been accepted for publication in the IEEE Transactions on Information Forensics and Security