利用自监督实现跨域人群计数
计算机视觉与模式识别
2021-03-31 v1 人工智能
摘要
最先进的拥挤场景人数统计方法依赖深度网络来估计人群密度。尽管有效,这些数据驱动方法依赖大量数据标注以获得良好性能,这阻碍了这些模型在紧急情况下的部署,因为此类情况下数据标注成本过高或无法快速获取。一种流行的解决方案是使用合成数据训练。遗憾的是,由于域偏移,所得模型在真实图像上泛化能力差。我们通过同时使用合成图像及其关联标签与无标签真实图像训练来弥补这一缺陷。为此,我们迫使网络通过学习区分上下颠倒的真实图像与正常图像来习得透视感知特征,并使其具备预测自身不确定性的能力,从而生成有用的伪标签用于微调。由此得到的算法在推理时无需额外计算,且持续优于 SOTA 的跨域人群计数方法。
引用
@article{arxiv.2103.16291,
title = {Leveraging Self-Supervision for Cross-Domain Crowd Counting},
author = {Weizhe Liu and Nikita Durasov and Pascal Fua},
journal= {arXiv preprint arXiv:2103.16291},
year = {2021}
}