基于深度强化学习的 DBSCAN 自动化
机器学习
2022-08-10 v1 信息检索
摘要
DBSCAN 因其简单实用而被广泛应用于许多科学和工程领域。然而,由于其参数高度敏感,聚类结果的准确性严重依赖于实践经验。本文首次提出一种新颖的深度强化学习引导的 DBSCAN 参数自动搜索框架,即 DRL-DBSCAN。该框架将通过感知聚类环境来调整参数搜索方向的过程建模为马尔可夫决策过程,旨在无需人工辅助地找到最佳聚类参数。DRL-DBSCAN 通过与聚类交互,使用弱监督奖励训练策略网络,学习针对不同特征分布的最优聚类参数搜索策略。此外,我们还提出了一种由数据规模驱动的递归搜索机制,以高效可控地处理大型参数空间。基于所提出的四种工作模式,在五个人工和真实世界数据集上进行了大量实验。离线和在线任务的结果表明,DRL-DBSCAN 不仅分别持续提升 DBSCAN 聚类精度达 26% 和 25%,而且能以高计算效率稳定找到主导参数。代码见 https://github.com/RingBDStack/DRL-DBSCAN。
引用
@article{arxiv.2208.04537,
title = {Automating DBSCAN via Deep Reinforcement Learning},
author = {Ruitong Zhang and Hao Peng and Yingtong Dou and Jia Wu and Qingyun Sun and Jingyi Zhang and Philip S. Yu},
journal= {arXiv preprint arXiv:2208.04537},
year = {2022}
}
备注
Accepted by CIKM 2022. The code is available at https://github.com/RingBDStack/DRL-DBSCAN