基于序数与有限基数信息的低失真聚类
计算机科学与博弈论
2024-02-07 v1
摘要
受计算社会选择领域近期工作的启发,我们将度量失真框架扩展至聚类问题。给定位于某底层度量空间中的 个智能体集合,我们的目标是将它们划分为 个簇,以优化某种社会成本目标。该度量空间由智能体位置间的距离函数 定义。关于 的信息仅通过 个排序隐式可用,其中每个智能体根据其他智能体与自身的距离对其进行排序。尽管如此,我们仍希望使用由 定义的社会成本目标来评估聚类算法。这是通过失真的概念来实现的,该概念衡量在考虑与可用序数信息一致的所有底层度量的情况下,聚类距离最优性有多远。遗憾的是,最重要的聚类目标不存在具有有限失真的算法。为了规避这一令人失望的事实,我们采用了两种替代方法:我们首先探讨资源增强是否有益。我们考虑使用超过 个簇的算法,但将其社会成本与最优 -聚类的社会成本进行比较。我们证明,使用(相对于 的)指数级数量的簇,可以在 -中心和 -中位数目标下获得低(常数或对数级)失真。有趣的是,我们证明了这种指数级膨胀是必要的。更重要的是,我们探讨了是否可以使用有限的基数信息来获得更好的结果。令人惊讶的是,对于 -中位数和 -中心,我们证明了数量在 上呈多项式且在 上仅为对数级(即在实际最相关的场景中,数量仅为智能体数量的次线性)的查询足以获得常数失真。
引用
@article{arxiv.2402.04035,
title = {Low-Distortion Clustering with Ordinal and Limited Cardinal Information},
author = {Jakob Burkhardt and Ioannis Caragiannis and Karl Fehrs and Matteo Russo and Chris Schwiegelshohn and Sudarshan Shyam},
journal= {arXiv preprint arXiv:2402.04035},
year = {2024}
}
备注
to appear in AAAI 2024