中文

基于信息论的方法:测度诱导混合分布下的违约损失预测

机器学习 2025-11-18 v1 人工智能

摘要

违约损失(LGD)建模面临根本性的数据质量约束:90%的可用训练数据由基于违约前资产负债表的代理估计代替实际从完成破产程序中获得的恢复结果。我们展示了,这种混合污染的训练结构导致递归分区方法系统性失效,在 held-out 测试数据上,随机森林实现的 r-squared 为负值(-0.664,甚至差于预测均值)。基于香农熵和互信息的信息论方法在1,218起企业性破产案例(1980-2023)中表现优异,分别实现 r-squared 为 0.191,RMSE 为 0.284。分析发现,杠杆率特征包含 1.510 位的互信息信息,而规模效应仅贡献 0.086 位,这与监管机构关于规模依赖性恢复的假设相矛盾。这些结果为在缺乏足够规模的代表性结果数据时,遵循巴塞尔三条款要求的金融机构部署 LGD 模型提供了实用指导。该研究结果可推广至医学结局研究、气候预测和技术可靠性领域,其中观察周期的延长在训练数据中不可避免地产生混合结构。

关键词

引用

@article{arxiv.2511.11596,
  title  = {Loss Given Default Prediction Under Measurement-Induced Mixture Distributions: An Information-Theoretic Approach},
  author = {Javier Marín},
  journal= {arXiv preprint arXiv:2511.11596},
  year   = {2025}
}