基于大型VLM的风格化体育解说生成
计算机视觉与模式识别
2025-08-28 v1 机器学习
摘要
大型(视觉)语言模型(LLM/LVLM)的出现,导致在社交媒体内容生成、搜索与推荐、医疗预后、用于认知任务的AI助手等多个领域涌现了大量自动化类人系统。尽管这些系统已成功集成到产品中,但它们在体育领域的应用,尤其是在准确识别和用自然语言描述比赛过程方面,关注甚少。现有的大多数LLM/LVLMs能够解释通用的体育活动,但缺乏足够的、以领域为中心的体育术语来生成自然(类人)的描述。本工作强调了现有最先进的LLM/LVLMs在根据图像生成所需风格化格式的生产级体育字幕方面的局限性,并提出了一种两级微调的LVLM流水线来解决此问题。与替代方法相比,所提出的流水线在F1分数上实现了>8-10%的提升,在BERT分数上实现了>2-10%的提升。此外,它具有较小的运行时内存占用和快速的执行时间。在第五十九届超级碗期间,该流水线证明了其在专业体育直播新闻中的实际应用能力;在比赛期间,以每3-5秒处理6张图像的速度,为超过1000张图像生成了高度准确且风格化的字幕。
引用
@article{arxiv.2508.19295,
title = {Large VLM-based Stylized Sports Captioning},
author = {Sauptik Dhar and Nicholas Buoncristiani and Joe Anakata and Haoyu Zhang and Michelle Munson},
journal= {arXiv preprint arXiv:2508.19295},
year = {2025}
}