FinLLMs:一种基于大语言模型的金融推理数据集生成框架
人工智能
2024-01-22 v1
摘要
大语言模型 (LLMs) 通常依赖大量的训练数据集。在金融领域,创建包含表格和长文本混合的数值推理数据集往往涉及高昂的人工标注成本。为解决数据资源有限并降低标注成本的问题,我们引入了 FinLLMs,这是一种基于常用金融公式并利用大语言模型生成金融问答数据的方法。首先,我们 compiling 了一份常用金融公式列表,并基于这些公式所使用的变量构建了一个图。随后,我们通过组合具有相同变量的公式作为新元素来扩充公式集。具体而言,我们探索了通过人工标注获得的公式,并通过遍历所构建的图将具有共享变量的公式进行合并。最后,利用 GPT-3.5,我们在收集的公式集基础上生成了涵盖表格信息和长文本内容的金融问答数据。我们的实验表明,由 FinLLMs 生成的合成数据有效提升了多种大规模数值推理模型在金融领域的性能,优于两个既有的基准金融问答数据集。
引用
@article{arxiv.2401.10744,
title = {FinLLMs: A Framework for Financial Reasoning Dataset Generation with Large Language Models},
author = {Ziqiang Yuan and Kaiyuan Wang and Shoutai Zhu and Ye Yuan and Jingya Zhou and Yanlin Zhu and Wenqi Wei},
journal= {arXiv preprint arXiv:2401.10744},
year = {2024}
}
备注
Under submission of IEEE Transactions