VideoConviction:用于人类确信与股票市场建议的多模态基准
多媒体
2025-07-14 v1 人工智能
计算与语言
计算机视觉与模式识别
摘要
社交媒体放大了金融意见领袖("finfluencer")的影响力,他们在YouTube等平台分享股票建议。理解他们的影响力需要分析超越文本的多模态信号,如语调、交付风格和面部表情,这些都超出基于文本的金融分析范畴。我们引入VideoConviction,一个包含6000多条专家标注的多模态数据集,通过457小时的人力工作量,旨在为多模态大语言模型(MLLMs)和基于文本的大语言模型(LLMs)在金融语境中的表现提供基准测试。我们的结果表明,虽然多模态输入有助于提取股票代码(例如提取Apple的股票代码AAPL),但MLLMs和LLMs在区分投资动作和确信度——即通过自信表达和详细推理所传递的信念强度——方面仍感到困惑,常将一般评论误分类为决定性建议。虽然高确信度的建议比低确信度的建议表现更好,但仍不甩S&P 500指数基金。一种逆向策略——反对finfluencer建议——在年收益率上超过S&P 5006.8%,但风险更大(Sharpe比率0.41 vs. 0.65)。我们的基准使对多模态任务进行多样化评估,比较模型在完整视频和分段视频输入上的性能。这促进了多模态金融研究的深入发展。我们的代码、数据集和评估排行榜均在CC BY-NC 4.0许可证下提供。
引用
@article{arxiv.2507.08104,
title = {VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations},
author = {Michael Galarnyk and Veer Kejriwal and Agam Shah and Yash Bhardwaj and Nicholas Meyer and Anand Krishnan and Sudheer Chava},
journal= {arXiv preprint arXiv:2507.08104},
year = {2025}
}