无监督聚类算法能否复现分类体系?
机器学习
2024-08-21 v1 机器学习
统计金融
应用统计
摘要
同行分析是投资管理的关键组成部分,常依赖专家提供的分类体系。当这些体系不与针对各种指标优化的无监督聚类算法所得的群体不一致时,其一致性受到质疑。我们调查无监督聚类是否能在标记数据集中复现真实类别,显示成功取决于特征选择和所选距离度量方式。我们使用 toy 数据集和基金分类作为实际案例,演示准确复现真实类别具有挑战性。我们还指出标准聚类评估指标在识别最佳聚类数相对于真实类别方面存在局限。随后我们表明,如果数据集中提供适当特征,并且已知合适的距离度量方式(例如使用基于监督随机森林的距离度量学习方法),则无监督聚类确实可以复现真实类别作为离散群体。
引用
@article{arxiv.2408.10340,
title = {Can an unsupervised clustering algorithm reproduce a categorization system?},
author = {Nathalia Castellanos and Dhruv Desai and Sebastian Frank and Stefano Pasquali and Dhagash Mehta},
journal= {arXiv preprint arXiv:2408.10340},
year = {2024}
}
备注
9 pages, 4 tables 28 figures