中文

信用风险遇见大语言模型:从P2P借贷中的贷款描述构建风险指标

风险管理 2025-03-25 v3 人工智能 计算与语言 机器学习

摘要

点对点(P2P)借贷通过线上平台连接借款人和投资人,但因投资人往往缺乏足够数据来评估借款人信用worthiness而存在显著的信息不对称。本文通过利用BERT这一大语言模型(LLM),因其能够捕捉文本中的上下文细微差别,基于来自Lending Club平台的数据集生成基于借款人贷款描述的风险评分。我们微调BERT以区分违约和非违约贷款,使用借款人提供的贷款描述。随后,将所得BERT生成的风险评分作为额外特征集成到用于贷款审批阶段的XGBoost分类器中,在该阶段决策者可获得的可用信息有限。该集成显著提升了预测性能,在平衡准确率和AUC方面均取得改进,凸显了文本特征在补充传统输入中的价值。此外,我们发现BERT评分的纠入会改变分类模型如何利用传统输入变量的方式,而这些变化因贷款目的而异。这些发现表明,BERT辨别了贷款描述中蕴含的有意义模式,包括借款人特征、特定目的以及语言特征。然而,大语言模型的固有不可解释性及其潜在偏差凸显了需要透明框架的需求,以确保监管合规并建立信任。总体而言,本研究展示了大语言模型从源头中如何与传统特征相互作用,为增强这些模型的可解释性和公平性开辟了新方向。

关键词

引用

@article{arxiv.2401.16458,
  title  = {Credit Risk Meets Large Language Models: Building a Risk Indicator from Loan Descriptions in P2P Lending},
  author = {Mario Sanz-Guerrero and Javier Arroyo},
  journal= {arXiv preprint arXiv:2401.16458},
  year   = {2025}
}