利用非金融特征进行信用风险估计:来自合成伊斯坦布尔数据集的证据
机器学习
2026-02-09 v3 统计金融
应用统计
摘要
金融排斥限制了创业精神,增加了收入波动性,并扩大了财富差距。伊斯坦布尔的银行服务不足消费者通常没有信用局档案,因为他们的收入和支付通过非正式渠道流动。为了研究如何评估此类借款人,我们创建了一个包含十万名伊斯坦布尔居民的合成数据集,该数据集再现了 2025 年第一季度 TÜİK (TURKSTAT) 的人口普查边缘分布和电信使用模式。检索增强生成将这些公共统计数据输入 OpenAI o3 模型,由该模型合成逼真但私密的数据记录。每个档案包含七个社会人口统计变量和九个替代属性,描述了手机规格、在线购物节奏、订阅支出、汽车拥有情况、月租金以及信用卡标志。为了测试替代金融数据的影响,CatBoost、LightGBM 和 XGBoost 各自被训练了两个版本。Demo 模型仅使用社会人口统计变量;Full 模型同时包含社会人口统计变量和替代属性。在五折分层验证中,替代数据块将曲线下面积提高了约 1.3 个百分点,并将平衡 F1 值从约 0.84 提升至 0.95,提升了 14%。我们贡献了一个开放的伊斯坦布尔 2025 年第一季度合成数据集、一个完全可复现的建模流程,以及实证证据,表明一组简洁的行为属性可以接近信用局级别的区分能力,同时服务于缺乏正式信用记录的借款人。这些发现为贷款机构和监管机构提供了一个透明的蓝图,以向银行服务不足的人群提供公平、安全的信贷服务。
引用
@article{arxiv.2512.12783,
title = {Credit Risk Estimation with Non-Financial Features: Evidence from a Synthetic Istanbul Dataset},
author = {Atalay Denknalbant and Emre Sezdi and Zeki Furkan Kutlu},
journal= {arXiv preprint arXiv:2512.12783},
year = {2026}
}