面向公平与多样数据摘要的核心集
数据结构与算法
2023-10-13 v1 机器学习
摘要
我们研究在公平性/划分约束下用于多样性最大化任务的核心集(core-set)构造算法。给定一个度量空间中被划分为个组的点的集合,以及给定的,该问题的目标是从每个组中选取个点,使得所选的个点的整体多样性最大化。我们考虑两种自然的多样性度量:成对距离之和与最近邻距离之和,并展示了针对这些度量的改进的核心集构造算法。更确切地说,我们展示了关于成对距离之和的第一个常数因子核心集,其大小与数据集大小和纵横比无关。其次,我们展示了关于最近邻距离之和的第一个核心集。最后,我们进行了若干实验以展示我们核心集方法的有效性。特别地,我们将约束多样性最大化应用于摘要一组定时消息,并考虑消息的时效性。具体而言,摘要应包含比旧消息更多的近期消息。这是某最大通信平台中的一项实际任务,影响着数亿日活跃用户的体验。通过将我们的核心集方法用于该任务,我们实现了100倍的加速,而多样性仅损失几个百分点。此外,我们的方法使我们在流式设置中改善了算法的空间使用。
引用
@article{arxiv.2310.08122,
title = {Core-sets for Fair and Diverse Data Summarization},
author = {Sepideh Mahabadi and Stojan Trajanovski},
journal= {arXiv preprint arXiv:2310.08122},
year = {2023}
}
备注
NeurIPS 2023