中文

Timehash:高效商业时间段搜索的层次化时间索引

数据库 2026-05-26 v2 信息检索

摘要

时间范围过滤是大规模搜索系统中的关键问题,尤其是位置服务筛选商家营业时间。传统方法 suffer from查询性能差(范围过滤)、索引大小爆炸(分钟级索引)或精度降低(粗粒度索引)。PostgreSQL TSRANGE with GiST索引提供了 exact语义,但在100K-1M规模下P50延迟为15-224 ms,难以用于交互式搜索,且无法嵌入反向索引管道。我们提出Timehash,一种层次化时间索引算法,在相对于分钟级索引中实现超过97%的索引大小减少,同时保持100%的精度。Timehash使用灵活的多分辨率策略,无缝集成到反向索引基础设施中。通过分析部署于18个月的生产位置搜索服务的1260万条记录,我们展示了通过边界分布分析实现的 domain-informed层次选择方法,在Yelp Open数据集(127K美国/加拿大商家)上进行跨数据集验证,其中相同的5级层次将总术语数减少至1分钟基线的0.77%(相对于生产数据集的2.17%)。我们评估了Timehash与naive反向方法、PostgreSQL GiST以及Elasticsearch中within-BKD基线。 在Yelp的单个Elasticsearch部署中,Timehash在匹配索引的前提下,对于典型的multi-predicate top-K工作负载(K <= 100),相对于native BKD实现实现1.14-2.17x更低的P50延迟,在大K值处的方法趋于一致,其中文档materialization占主导。五级层次(4h, 1h, 15m, 5m, 1m)将索引术语数减少至每个文档9.6个,实现97.8%的减少和46倍的压缩,同时实现零误报和零漏报。每个文档的成本在100K到1260万POI之间保持恒定,同时支持break times、不规则日程和跨午夜的范围。

引用

@article{arxiv.2603.02941,
  title  = {Timehash: Hierarchical Time Indexing for Efficient Business Hours Search},
  author = {Jinoh Kim and Jaewon Son},
  journal= {arXiv preprint arXiv:2603.02941},
  year   = {2026}
}

备注

pages, 1 figure, 8 tables. Submitted to ACM CIKM 2026 (Applied Research Track)