中文

FinGPT:将互联网规模数据民主化以构建金融大语言模型

计算与语言 2023-11-15 v2 机器学习 综合金融

摘要

大语言模型(LLMs)在理解和生成类人文本方面展现出卓越能力,有可能彻底变革金融业。然而,现有LLMs在金融领域往往表现不足,这主要归因于通用文本数据与金融文本数据之间的差异。遗憾的是,可用的金融文本数据集数量有限,且首个金融LLM(FinLLM)BloombergGPT是闭源的(仅发布了训练日志)。有鉴于此,我们旨在将互联网规模的金融数据民主化以用于LLMs,这是一个开放挑战,原因在于数据源多样、信噪比低以及时间有效性高。为应对这些挑战,我们引入一个开源的、以数据为中心的框架——金融生成式预训练Transformer(FinGPT),它自动化地从互联网上34个不同来源收集和整理实时金融数据,为研究者和从业者提供可访问且透明的资源来开发其FinLLMs。此外,我们提出一种简单而有效的策略,利用市场的内在反馈来微调FinLLM,称为基于股价的强化学习(RLSP)。我们还采用低秩适配(LoRA、QLoRA)方法,使用户能够以低成本从通用LLMs定制自己的FinLLMs。最后,我们展示了若干FinGPT应用,包括智能投顾、用于算法交易的情感分析以及低代码开发。FinGPT旨在使FinLLMs民主化、激发创新并解锁开放金融中的新机遇。代码已开源。

关键词

引用

@article{arxiv.2307.10485,
  title  = {FinGPT: Democratizing Internet-scale Data for Financial Large Language Models},
  author = {Xiao-Yang Liu and Guoxuan Wang and Hongyang Yang and Daochen Zha},
  journal= {arXiv preprint arXiv:2307.10485},
  year   = {2023}
}

备注

43 pages, 8 tables, and 2 figures