中文

基于 NLP 聚类与机器学习的信用风险模型问题剖析:来自验证报告的洞察

机器学习 2023-06-05 v1

摘要

本文探讨利用聚类方法与机器学习算法(包括自然语言处理(NLP)),通过验证报告中的文本信息识别并分类信用风险模型中发现的问题。使用的数据集独特,包含某大型国际银行集团验证团队在 2019 年 1 月至 2022 年 12 月期间提出的 657 项发现。这些发现被划分为九个验证维度,并由验证人员凭借专业知识赋予严重等级。作者利用四种不同预训练模型对发现的标题与观测生成嵌入,包括来自 TensorFlow Hub 的“module_url”,以及来自 SentenceTransformer 库的三种模型:“all-mpnet-base-v2”、“all-MiniLM-L6-v2”和“paraphrase-mpnet-base-v2”。本文运用并比较了多种聚类方法,对具有相似特征的发现进行分组,从而能在各验证维度与严重度内识别共性问题。研究结果表明,聚类是一种有效的信用风险模型问题识别与分类方法,准确率高于 60%。作者还采用逻辑回归与 XGBoost 等机器学习算法预测验证维度及其严重度,XGBoost 算法准确率达 80%。此外,本研究识别出预测验证维度与严重度的前 10 个关键词。总体而言,本文通过证明聚类与机器学习在分析验证报告文本信息中的效用,并揭示信用风险模型开发与验证中遇到的问题类型,作出了贡献。

关键词

引用

@article{arxiv.2306.01618,
  title  = {Analyzing Credit Risk Model Problems through NLP-Based Clustering and Machine Learning: Insights from Validation Reports},
  author = {Szymon Lis and Mariusz Kubkowski and Olimpia Borkowska and Dobromił Serwa and Jarosław Kurpanik},
  journal= {arXiv preprint arXiv:2306.01618},
  year   = {2023}
}

备注

8 pages, 7 tables, 2 figures