解锁财务洞察:面向财务咨询视频的先进多模态摘要与多模态输出框架
计算机视觉与模式识别
2025-09-26 v1 人工智能
摘要
社交媒体的动态传播拓宽了财务咨询内容通过播客视频的触达范围,但从冗长、多模态的片段(30-40 分钟)中提取洞察仍具有挑战性。我们提出了 FASTER(Financial Advisory Summariser with Textual Embedded Relevant images),一个模块化框架,解决三个关键挑战:(1)提取模态特定特征,(2)生成优化的简洁摘要,(3)将视觉关键帧与相关文本点对齐。FASTER 采用 BLIP 进行语义视觉描述、OCR 进行文本模式识别,以及基于 Whisper 的转录与说话人分离作为 BOS 特征。带有 BOS 特定事实核查的改进型直接偏好优化(DPO)损失函数确保与人工对齐摘要相比的精确性、相关性和事实一致性。基于排序的检索机制进一步将关键帧与摘要内容对齐,增强可解释性和跨模态一致性。为应对数据资源稀缺问题,我们引入 Fin-APT,一个包含 470 个公开可获取的财务咨询励志演讲视频的数据集,用于鲁棒的多模态研究。全面的跨领域实验证实了 FASTER 相较于大语言模型(LLMs)和视觉-语言模型(VLMs)的强劲性能、鲁棒性和泛化能力。通过建立多模态摘要的新标准,FASTER 使财务咨询内容更易获取和可操作,从而为研究开辟了新途径。数据集和代码可在以下地址获取:https://github.com/sarmistha-D/FASTER
引用
@article{arxiv.2509.20961,
title = {Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos},
author = {Sarmistha Das and R E Zera Marveen Lyngkhoi and Sriparna Saha and Alka Maurya},
journal= {arXiv preprint arXiv:2509.20961},
year = {2025}
}