利用 LLM 从 10-K 文件中提取分类对齐的风险因素及自主改进
计算与语言
2026-01-22 v1
摘要
我们提出了一种从企业 10-K 文件中提取结构化风险因素的方法,同时保持对预定义分层分类体系的遵循。我们的三阶段流水线将 LLM 提取与支持性引文相结合,利用基于嵌入的语义映射对应至分类类别,并通过 LLM-as-a-judge 验证过滤虚假分配。为评估我们的方法,我们从 S&P 500 公司中提取了 10,688 个风险因素,并考察了行业聚类间的风险特征相似度。除提取外,我们引入了自主分类体系维护,其中 AI 智能体分析评估反馈以识别问题类别、诊断失败模式并提出改进建议,在案例研究中实现了嵌入分离度 104.7% 的提升。外部验证证实该分类体系捕捉了具有经济学意义的结构:同行业公司的风险特征相似度比跨行业对高出 63%(Cohen's d=1.06,AUC 0.82,p<0.001)。该方法可推广至任何需要从非结构化文本中进行分类对齐提取的领域,自主改进使得系统能够在处理更多文档时实现持续的质量维护与提升。
引用
@article{arxiv.2601.15247,
title = {Taxonomy-Aligned Risk Extraction from 10-K Filings with Autonomous Improvement Using LLMs},
author = {Rian Dolphin and Joe Dursun and Jarrett Blankenship and Katie Adams and Quinton Pike},
journal= {arXiv preprint arXiv:2601.15247},
year = {2026}
}
备注
4 figures, 9 pages