中文

FinCap:面向短视频财经 YouTube 视频的主题对齐字幕

计算机视觉与模式识别 2025-10-01 v1 计算与语言 多媒体

摘要

我们通过测试对文本(T)、音频(A)和视频(V)的联合推理,评估了多模态大语言模型(MLLM)在财经短视频(SV)中进行主题对齐字幕生成的能力。我们使用 624 个标注的 YouTube 短视频,评估了所有七种模态组合(T、A、V、TA、TV、AV、TAV)在五个主题上的表现:主要推荐、情感分析、视频目的、视觉分析和金融实体识别。仅视频模态在五个主题中的四个上表现强劲,突显了其在捕捉视觉上下文以及情绪、手势和肢体语言等有效线索方面的价值。选择性组合(如 TV 或 AV)通常优于 TAV,这意味着过多的模态可能会引入噪声。这些结果为金融短视频字幕生成建立了首个基线,并展示了在该领域对复杂视觉线索进行基础建模的潜力与挑战。所有代码和数据均可在我们的 Github 上根据 CC-BY-NC-SA 4.0 许可证获取。

关键词

引用

@article{arxiv.2509.25745,
  title  = {FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos},
  author = {Siddhant Sukhani and Yash Bhardwaj and Riya Bhadani and Veer Kejriwal and Michael Galarnyk and Sudheer Chava},
  journal= {arXiv preprint arXiv:2509.25745},
  year   = {2025}
}

备注

ICCV Short Video Understanding Workshop Paper