赋能多数,偏倚少数:通过大语言模型实现通才信用评分
机器学习
2024-02-20 v3 人工智能
计算与语言
计算机与社会
摘要
在金融业中,信用评分是一个基本要素,塑造着个人与企业的信贷获取并决定贷款条款。然而,传统信用评分方法常面临诸如知识范围狭窄与信用任务孤立评估等挑战。我们的工作主张大语言模型(LLMs)在信用评分任务中具有巨大潜力,具备跨多任务的强泛化能力。为系统性探索 LLMs 用于信用评分,我们提出首个开源综合框架。我们策划了一个涵盖 9 个数据集、14K 样本的新基准,专为信用评估及批判审视 LLMs 内潜在偏倚而定制,以及含逾 45k 样本的新指令微调数据。我们随后通过指令微调提出首个信用与风险评估大语言模型(CALM),以适配各类金融风险评测任务的细微需求。我们在所建基准上评估 CALM、现有最优(SOTA)方法、开源与闭源 LLMs。我们的实证结果揭示了 LLMs 不仅匹敌且超越传统模型的能力,指向一个信用评分可更具包容性、全面性与无偏见的未来。我们通过向研究界与金融业共享开创性的指令微调数据集、信用与风险评估 LLM 及基准,助力行业转型。
引用
@article{arxiv.2310.00566,
title = {Empowering Many, Biasing a Few: Generalist Credit Scoring through Large Language Models},
author = {Duanyu Feng and Yongfu Dai and Jimin Huang and Yifang Zhang and Qianqian Xie and Weiguang Han and Zhengyu Chen and Alejandro Lopez-Lira and Hao Wang},
journal= {arXiv preprint arXiv:2310.00566},
year = {2024}
}