中文

基于目标函数的深度嵌入向量层次聚类

机器学习 2022-06-10 v2 人工智能 数据结构与算法 机器学习

摘要

我们对基于目标函数的层次聚类方法在由计算机视觉与 NLP 应用的深度嵌入向量构成的海量数据集上开展了全面的实验研究。这包括来自多个近期流行模型(如 ResNet、ResNext、Inception V3、SBERT)的大量图像嵌入(ImageNet、ImageNetV2、NaBirds)、词嵌入(Twitter、Wikipedia)与句子嵌入(SST-2)向量。我们的研究涵盖多达 4.54.5 百万条目、嵌入维度高达 20482048 的数据集。为应对将层次聚类扩展至此类大型数据集的挑战,我们提出一种新的实用层次聚类算法 B++&C。相较于广泛的经典方法与近期启发式方法,其在流行的 Moseley-Wang (MW) / Cohen-Addad 等人 (CKMM) 目标(归一化)上平均带来 5%/20% 的提升。我们还引入了一种理论算法 B2SAT&C,其在多项式时间内对 CKMM 目标达到 0.740.74 近似。这是相对于随机二叉树所得平凡 2/32/3 近似的首次实质性改进。在此之前,由 Charikar 等人(SODA'19)给出的最佳多项式时间近似为 2/3+0.0004\approx 2/3 + 0.0004

关键词

引用

@article{arxiv.2012.08466,
  title  = {Objective-Based Hierarchical Clustering of Deep Embedding Vectors},
  author = {Stanislav Naumov and Grigory Yaroslavtsev and Dmitrii Avdiukhin},
  journal= {arXiv preprint arXiv:2012.08466},
  year   = {2022}
}