排序函数中参数的重要性
数据库
2026-01-12 v1 数据结构与算法
摘要
给定列权重在决定表中元组排序方面有多重要?为回答关于排序函数的解释性问题,我们调查计算列权重的 SHAP 分数的计算,采用 Grohe 等人[ICDT'24] 最近的框架。该分数的数确定义依赖于三个关键组件:(1) 当前使用的排序函数;(2) 量化使用替代权重对排序影响的效应函数;(3) 底层权重分布。我们分析了不同实例在各种基本排序和效应函数下的计算复杂度,关注概率独立的有限分布对 individual 列。对于排序函数,我们检查 lexicographic 顺序和由求和、最小值、最大值函数定义的得分基序。对于效应函数,我们考虑全局、top-k 和 local 视角:全局措施量化扰动后排序与原始排序之间的偏差,top-k 措施检查前 k 个答案集合的变化,local 措施捕捉对感兴趣单个元组影响。尽管所有情况都允许实现的全概率多项式时间随机近似方案 (FPRAS),我们确立了精确计算的复杂度,确定哪些情况可在多项式时间内解决,哪些情况是 #P-hard 的。我们进一步展示,所有复杂度结果、下界和上界都适用于计算整个列的 Shapley 值(无论其权重)的相关任务。
引用
@article{arxiv.2601.06001,
title = {The Importance of Parameters in Ranking Functions},
author = {Christoph Standke and Nikolaos Tziavelis and Wolfgang Gatterbauer and Benny Kimelfeld},
journal= {arXiv preprint arXiv:2601.06001},
year = {2026}
}
备注
Extended version of ICDT 2026 paper