信用风险监控系统中异构数据的高级谱聚类
机器学习
2025-09-03 v1 计算与语言
摘要
包含数值型金融变量和文本记录的异构数据给信用监控带来了重大挑战。为解决这一问题,我们提出高级谱聚类(ASC),一种通过优化权重参数整合金融与文本相似性,并使用新颖的特征值-轮廓优化方法选择特征向量的方法。在包含 1,428 家中小企业(SME)的数据集上进行评估,ASC 取得的轮廓分数比单类型数据基线方法高 18%。此外,所得聚类提供了可操作的洞察;例如,51% 的低风险企业的文本记录中包含“社会招聘”一词。ASC 的鲁棒性在多种聚类算法中得到验证,包括 k-means、k-medians 和 k-medoids,其中 {\Delta}Intra/Inter < 0.13 且 {\Delta}轮廓系数 < 0.02。通过将谱聚类理论与异构数据应用相结合,ASC 能够识别出有意义的聚类,例如以招聘为重点且违约风险低 30% 的中小企业,从而支持更有针对性和更有效的信用干预。
引用
@article{arxiv.2509.00546,
title = {Advanced spectral clustering for heterogeneous data in credit risk monitoring systems},
author = {Lu Han and Mengyan Li and Jiping Qiang and Zhi Su},
journal= {arXiv preprint arXiv:2509.00546},
year = {2025}
}
备注
25 pages, 7 figures, 6 tables