中文

基于序数与有限基数信息的低失真聚类

计算机科学与博弈论 2024-02-07 v1

摘要

受计算社会选择领域近期工作的启发,我们将度量失真框架扩展至聚类问题。给定位于某底层度量空间中的 nn 个智能体集合,我们的目标是将它们划分为 kk 个簇,以优化某种社会成本目标。该度量空间由智能体位置间的距离函数 dd 定义。关于 dd 的信息仅通过 nn 个排序隐式可用,其中每个智能体根据其他智能体与自身的距离对其进行排序。尽管如此,我们仍希望使用由 dd 定义的社会成本目标来评估聚类算法。这是通过失真的概念来实现的,该概念衡量在考虑与可用序数信息一致的所有底层度量的情况下,聚类距离最优性有多远。遗憾的是,最重要的聚类目标不存在具有有限失真的算法。为了规避这一令人失望的事实,我们采用了两种替代方法:我们首先探讨资源增强是否有益。我们考虑使用超过 kk 个簇的算法,但将其社会成本与最优 kk-聚类的社会成本进行比较。我们证明,使用(相对于 kk 的)指数级数量的簇,可以在 kk-中心和 kk-中位数目标下获得低(常数或对数级)失真。有趣的是,我们证明了这种指数级膨胀是必要的。更重要的是,我们探讨了是否可以使用有限的基数信息来获得更好的结果。令人惊讶的是,对于 kk-中位数和 kk-中心,我们证明了数量在 kk 上呈多项式且在 nn 上仅为对数级(即在实际最相关的场景中,数量仅为智能体数量的次线性)的查询足以获得常数失真。

关键词

引用

@article{arxiv.2402.04035,
  title  = {Low-Distortion Clustering with Ordinal and Limited Cardinal Information},
  author = {Jakob Burkhardt and Ioannis Caragiannis and Karl Fehrs and Matteo Russo and Chris Schwiegelshohn and Sudarshan Shyam},
  journal= {arXiv preprint arXiv:2402.04035},
  year   = {2024}
}

备注

to appear in AAAI 2024