中文

多样化相似性搜索的福利主义公式

数据结构与算法 2026-02-10 v1 计算几何 计算机科学与博弈论 信息检索 机器学习

摘要

最近邻搜索(NNS)是数据结构中的一个基本问题,具有广泛的应用,例如网络搜索、推荐系统以及最近的检索增强生成(RAG)。在诸如此类的最新应用中,除了返回邻居的相关性(相似性)之外,邻居之间的多样性也是一个核心要求。在本文中,我们开发了 NNS 中基于福利的原则性公式,以实现跨属性的多样性。我们的公式基于来自数理经济学的福利函数——这些函数满足核心的多样性(公平性)和相关性(经济效率)公理。特别关注纳什社会福利,我们注意到我们基于福利的公式提供了目标函数,该函数以查询相关的方式自适应地平衡相关性和多样性。值得注意的是,这种平衡在先前的基于约束的方法中是不存在的,后者强制了一个固定的多样性水平并优化相关性。此外,我们的公式提供了一种参数化方法来控制相关性和多样性之间的权衡,为从业者提供了根据任务特定需求定制搜索结果的灵活性。我们为基于福利的目标开发了具有可证明保证的高效最近邻算法。值得注意的是,我们的算法可以应用于任何标准 ANN 方法之上(即,使用标准 ANN 方法作为子程序),以高效地找到近似最大化我们基于福利的目标的邻居。实验结果表明,我们的方法是实用的,并且在保持检索邻居高相关性的同时,显著提高了多样性。

关键词

引用

@article{arxiv.2602.08742,
  title  = {Welfarist Formulations for Diverse Similarity Search},
  author = {Siddharth Barman and Nirjhar Das and Shivam Gupta and Kirankumar Shiragur},
  journal= {arXiv preprint arXiv:2602.08742},
  year   = {2026}
}