中文

DaSy:一个可扩展数据序列相似性搜索库

数据库 2026-03-31 v1

摘要

大型数据集合上进行精确相似性搜索是现代应用中的基本操作,但现有解决方案往往碎片化、专业化,或针对特定执行环境进行优化。本文提出了DaSy,一款统一的数据序列相似性搜索库,将多种最先进算法集成于单一、连贯的框架中。DaSy是第一个支持跨多种执行环境进行精确相似性搜索的库,包括面向磁盘、内存、GPU加速和分布式可扩展相似性搜索的实现。虽然为数据序列设计,DaSy也直接适用于向量数据的精确相似性搜索,使其在更广泛的应用场景中具有适用性。该库支持C++和Python两种接口,使用户能够轻松将其功能集成到各种任务中。DaSy是开源的,可在:https://github.com/MChatzakis/DaiSy 获取。

关键词

引用

@article{arxiv.2603.27719,
  title  = {DaiSy: A Library for Scalable Data Series Similarity Search},
  author = {Francesca Del Gaudio and Manos Chatzakis and Gayathiri Ravendirane and Botao Peng and Themis Palpanas},
  journal= {arXiv preprint arXiv:2603.27719},
  year   = {2026}
}