从文本到α:大语言模型能否追踪公司披露文件中的演化信号?
计算工程、金融与科学
2026-03-17 v5
摘要
自然语言处理(NLP)广泛应用于量化金融领域,但传统方法往往难以捕捉公司披露文件中丰富的叙事,导致 potentially 信息性信号被低估。大语言模型(LLM)因其提取细粒度语义的能力,成为具有潜在 promise 的替代方案。本文探讨了由 LLM 从公司披露文件中提取的语义信号是否能预测α收益,即超出广泛市场走势和常见风险因子的异常收益。我们提出一种简单框架:LLM 作为提取器,嵌入向量作为衡 ruler,提取上下文感知的、以指标为焦点的文本片段,并通过基于嵌入的相似性衡量连续披露期间的语义变化。这样即可度量指标转移的程度——企业远离之前强调的指标的程度,称为 moving targets。在针对最新基于命名实体识别(NER)基线的方法进行的投资组合和横截面回归实验中,我们的方法在风险调整后α收益方面实现了超过两倍的提升,并显示出显著更强的预测能力。定性分析表明,这些收益提升源于保留上下文限定词,并过滤掉关键词方法常忽略的非指标术语。
引用
@article{arxiv.2510.03195,
title = {From Text to Alpha: Can LLMs Track Evolving Signals in Corporate Disclosures?},
author = {Chanyeol Choi and Yoon Kim and Yu Yu and Young Cha and V. Zach Golkhou and Igor Halperin and Georgios Papaioannou and Minkyu Kim and Zhangyang Wang and Jihoon Kwon and Minjae Kim and Alejandro Lopez-Lira and Yongjae Lee},
journal= {arXiv preprint arXiv:2510.03195},
year = {2026}
}
备注
9 pages