PyFi:通过对抗智能体实现类似金字塔的金融图像理解
计算金融
2026-04-09 v2 人工智能
计算机视觉与模式识别
摘要
本文提出 PyFi 框架,构建类似金字塔的金融图像理解体系,使视觉语言模型(VLM)能够以渐进、由简到繁的方式推演问题链。PyFi 的核心是 PyFi-600K 数据集,包含 60 万金融问答对,按推理金字塔结构组织:底层问题仅需基础感知,而向上层推进则要求模型在金融视觉理解和专业知识方面具备日益提升的能力。该数据集因无需人工标注而具可扩展性,利用 PyFi-adv 实现——一种基于蒙特卡洛树搜索(MCTS)范式的多智能体对抗机制。该机制中,针对每张图片,挑战者智能体与求解者智能体竞争,生成逐层深入的金融视觉推理问题链。借助该数据集,我们对先进 VLM 在金融领域进行细粒度、分层且全面的评估。此外,在金字塔结构问题链上微调Qwen2.5-VL-3B 和 Qwen2.5-VL-7B,使这些模型能够通过分解问题为逐步提升推理需求的子问题来回答复杂金融问题,分别在数据集上实现 19.52% 和 8.06% 的平均准确率提升。所有代码、数据集和模型均已公开:https://github.com/AgenticFinLab/PyFi。
引用
@article{arxiv.2512.14735,
title = {PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents},
author = {Yuqun Zhang and Yuxuan Zhao and Sijia Chen},
journal= {arXiv preprint arXiv:2512.14735},
year = {2026}
}