中文

视觉语言模型是否真正“阅读”了蜡烛图?面向视觉股票价格预测的多尺度基准

机器学习 2026-04-15 v1 计算与语言

摘要

视觉语言模型 (VLM) 越来越多地被应用于视觉股票价格预测,但现有基准不足以评估它们对蜡烛图中股票价格的理解。首先,先前的研究未能隔离 VLM 对视觉输入的理解是否真正提高了预测性能以及 VLM 是否真正理解蜡烛图案。其次,大多数现有数据集和评估设置是围绕单周期或表格输入设计的。然而,人类分析师强烈依赖多尺度蜡烛图,其中更长的期限捕捉趋势方向,更短的期限提供拐点线索,这使得系统性评估 VLM 整合短期和长期视觉市场动态的能力变得困难。为弥合这一差距,我们构建了一个多尺度蜡烛图数据集和一个标准化的评估框架,以评估 VLM 利用多尺度视觉市场信号的能力。评估结合基于混淆矩阵的诊断与信息系数 (IC) 时间序列指标,并包括 XGBoost 作为基于特征的时序基线。使用该数据集,我们对代表性 VLM 进行基准测试并分析其利用多尺度股票价格数据的能力。实验结果表明,大多数 VLM 在持续的上升或下降趋势条件下表现良好,而在更常见的市场情景中表现出弱预测能力。我们还识别出显著的预测偏差和对明确指定预测时段的 prompt 敏感性有限,表明其在精确时序推理方面存在内在局限。

关键词

引用

@article{arxiv.2604.12659,
  title  = {Do VLMs Truly "Read" Candlesticks? A Multi-Scale Benchmark for Visual Stock Price Forecasting},
  author = {Kaiqi Hu and Linda Xiao and Shiyue Xu and Ziyi Tang and Mingwen Liu},
  journal= {arXiv preprint arXiv:2604.12659},
  year   = {2026}
}

备注

We evaluate whether VLMs can comprehend multi-scale visual stock price data like human analysts with a proposed benchmark, identifying current VLMs' weak predictive power, significant biases, and limited sensitivity to forecast horizons and prompts