中文

关于聚类预训练嵌入的实证研究:深度方法一定更好吗?

计算机视觉与模式识别 2022-11-11 v1 机器学习

摘要

最近关于人脸嵌入聚类的研究发现,无监督的、浅层的、基于启发式的方法——包括 kk-means 和层次凝聚聚类——的表现不如有监督的、深层的、归纳式方法。虽然报告的改进确实令人印象深刻,但实验大多局限于人脸数据集,其中聚类的嵌入具有高度区分性或类别分离良好(Recall@1 高于 90% 且通常接近上限),并且实验方法似乎偏向于深度方法。我们在三个数据集上对 17 种聚类方法进行了大规模的实证研究,并获得了几项稳健的发现。值得注意的是,对于具有更多不确定性的嵌入,深度方法出人意料地脆弱,其表现与基于启发式的浅层方法相当甚至更差。当嵌入具有高度区分性时,深度方法确实优于基线,这与过去的结果一致,但方法之间的差距远小于此前报道的差距。我们相信我们的基准测试将有监督聚类方法的范围扩展到了人脸领域之外,并可以作为改进这些方法的基础。为了确保可复现性,我们在附录中包含了所有必要的细节,并计划发布代码。

关键词

引用

@article{arxiv.2211.05183,
  title  = {An Empirical Study on Clustering Pretrained Embeddings: Is Deep Strictly Better?},
  author = {Tyler R. Scott and Ting Liu and Michael C. Mozer and Andrew C. Gallagher},
  journal= {arXiv preprint arXiv:2211.05183},
  year   = {2022}
}