中文

用于SEC风险预测的预见性学习

机器学习 2026-01-28 v1

摘要

SEC文件中的风险披露描述了潜在的不利事件,但很少量化其可能性,这限制了它们在概率分析中的效用。一个核心障碍是缺乏大规模、风险级别的监督,将披露的风险与已实现的结果联系起来。我们引入了一个全自动数据生成流程,仅使用公开数据将定性的SEC风险披露转换为具有时间基础的监督。对于每份文件,该流程从“风险因素”部分生成公司特定的、有时间限制的风险查询,并通过自动对照后续披露解析结果来标记它们。利用这个基于SEC文件的风险查询和结果数据集,我们训练了一个紧凑的大型语言模型,以估计一个已披露风险在指定期限内实现的可能性。尽管其规模不大,但所得模型在概率准确性和校准方面,相较于预训练和启发式基线模型有显著提升,并超越了包括GPT-5在内的前沿通用模型。更广泛地说,这项工作表明,预见学习(Foresight Learning)能够仅使用原始的、按时间顺序排列的领域内文本,实现领域特定专家模型的可扩展和全自动训练——无需专有数据、外部语料库或人工标注。由此产生的模型在单个GPU上即可部署,同时实现了前沿水平的性能。这一结果揭示了一条从自然产生的企业文档中学习校准的、与决策相关的信号的通用途径。为了支持透明度和可复现性,我们开源了本研究中使用的评估数据集。评估数据:https://huggingface.co/datasets/LightningRodLabs/sec_risk_questions_test_set 数据生成平台:https://lightningrod.ai/ SDK:https://github.com/lightning-rod-labs/lightningrod-python-sdk

关键词

引用

@article{arxiv.2601.19189,
  title  = {Foresight Learning for SEC Risk Prediction},
  author = {Benjamin Turtel and Paul Wilczewski and Danny Franklin and Kris Skotheim},
  journal= {arXiv preprint arXiv:2601.19189},
  year   = {2026}
}