FinLMM-R1:通过可扩展数据与奖励设计提升金融推理能力
计算与语言
2025-06-17 v1
摘要
大型多模态模型(LMM)展示出显著的跨模态推理能力。然而,金融应用面临数据质量不足和现有训练范式效率低下的挑战。为此,本文提出FinLMM-R1框架,集成自动可扩展的数据构建管道与增强训练策略,以提升LMM的多模态推理能力。自动可扩展管道(ASP)通过独立的问答生成与图像-问题对齐范式,解决金融报告中的文本-视觉错位问题,确保数据完整性与提取效率。通过ASP,我们收集了89,378组对齐的图像-问题配对,涵盖算术推理、统计推理、金融解释和金融知识等任务。此外,本文引入“在LMM中使用对抗奖励思考”(TAR-LMM),扩展了前期两阶段训练框架,加入额外奖励机制。在第一个阶段,我们聚焦文本任务,采用格式奖励和准确率奖励引导模型生成结构化思考内容。在第二个阶段,我们构建多图像对比样本,加入图像选择、思考内容长度和对抗奖励等额外奖励,联合优化LMM在视觉感知、推理效率和逻辑连贯性方面的表现。7个基准测试的广泛实验表明,ASP构建的数据集和训练框架在通用和金融多模态情境中显著提升了答案准确率和推理深度,超越现有推理型LMM。
引用
@article{arxiv.2506.13066,
title = {FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design},
author = {Kai Lan and Jiayong Zhu and Jiangtong Li and Dawei Cheng and Guang Chen and Changjun Jiang},
journal= {arXiv preprint arXiv:2506.13066},
year = {2025}
}
备注
26 pages, 16 figures