基于合成数据的金融问答表格-文档提示调优
人工智能
2025-11-17 v2
摘要
财务文档如业绩报告或资产负债表常涉及长表格和多页报告。大型语言模型已成为帮助进行数值推理和理解此类文档的新工具。然而,提示质量对 LLM 在这些金融推理任务中的性能影响巨大。目前大多数方法是在固定的金融文本或表格数据集上进行提示调优,这限制了其适应新问题类型或文档结构的能力,或需要昂贵的手动标注/精选数据集来构建提示。我们引入一种由数据增强优化驱动的自我改进提示框架。在此闭环过程中,我们生成合成金融表格和文档摘录,验证其正确性和鲁棒性,然后根据结果更新提示。具体而言,我们的框架将合成数据生成器、验证器和提示优化器组合在一起,其中生成器产生新的示例以暴露当前提示的弱点,验证器检查所生成示例的有效性和鲁棒性,优化器则据此逐步细化提示。通过在反馈循环中迭代这些步骤,我们的方法无需依赖外部标签,即可在金融推理任务上稳步提升提示准确率。在 DocMath-Eval 基准测试上的评估表明,我们的系统在准确率和鲁棒性方面均优于标准提示方法,凸显了将合成数据生成纳入金融应用提示学习中的价值。
引用
@article{arxiv.2511.06292,
title = {Synthetic Data-Driven Prompt Tuning for Financial QA over Tables and Documents},
author = {Yaoning Yu and Kai-Min Chang and Ye Yu and Kai Wei and Haojing Luo and Haohan Wang},
journal= {arXiv preprint arXiv:2511.06292},
year = {2025}
}