scikit-hubness:枢纽度约简与近似近邻搜索
机器学习
2021-01-12 v1 信息检索
机器学习
摘要
本文介绍 scikit-hubness,一个用于高维空间高效最近邻搜索的 Python 包。枢纽度是维度灾难的一个方面,已知会损害包括分类、聚类和可视化在内的各种学习任务。scikit-hubness 提供用于枢纽度分析的算法(“我的数据是否受枢纽度影响?”)、枢纽度约简(“我们如何改善高维中的邻域检索?”)以及近似近邻搜索(“它对大型数据集有效吗?”)。它集成于 scikit-learn 环境中,使基于 Python 的机器学习研究者和从业者能够快速采用。用户将找到 scikit-learn neighbors 包的所有功能,加上对透明枢纽度约简和近似最近邻搜索的额外支持。scikit-hubness 使用若干质量评估工具和原则开发,例如 PEP8 合规、高代码覆盖率的单元测试、所有主要平台(Linux、MacOS、Windows)上的持续集成,以及 LGTM 的额外检查。源代码可在 https://github.com/VarIr/scikit-hubness 以 BSD 3-clause 许可证获取。使用 $ pip install scikit-hubness 从 Python 包索引安装。
引用
@article{arxiv.1912.00706,
title = {scikit-hubness: Hubness Reduction and Approximate Neighbor Search},
author = {Roman Feldbauer and Thomas Rattei and Arthur Flexer},
journal= {arXiv preprint arXiv:1912.00706},
year = {2021}
}