基于目标函数的深度嵌入向量层次聚类
机器学习
2022-06-10 v2 人工智能
数据结构与算法
机器学习
摘要
我们对基于目标函数的层次聚类方法在由计算机视觉与 NLP 应用的深度嵌入向量构成的海量数据集上开展了全面的实验研究。这包括来自多个近期流行模型(如 ResNet、ResNext、Inception V3、SBERT)的大量图像嵌入(ImageNet、ImageNetV2、NaBirds)、词嵌入(Twitter、Wikipedia)与句子嵌入(SST-2)向量。我们的研究涵盖多达 百万条目、嵌入维度高达 的数据集。为应对将层次聚类扩展至此类大型数据集的挑战,我们提出一种新的实用层次聚类算法 B++&C。相较于广泛的经典方法与近期启发式方法,其在流行的 Moseley-Wang (MW) / Cohen-Addad 等人 (CKMM) 目标(归一化)上平均带来 5%/20% 的提升。我们还引入了一种理论算法 B2SAT&C,其在多项式时间内对 CKMM 目标达到 近似。这是相对于随机二叉树所得平凡 近似的首次实质性改进。在此之前,由 Charikar 等人(SODA'19)给出的最佳多项式时间近似为 。
引用
@article{arxiv.2012.08466,
title = {Objective-Based Hierarchical Clustering of Deep Embedding Vectors},
author = {Stanislav Naumov and Grigory Yaroslavtsev and Dmitrii Avdiukhin},
journal= {arXiv preprint arXiv:2012.08466},
year = {2022}
}