中文

Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning

计算机视觉与模式识别 2025-07-29 v1

摘要

现有体育视频字幕方法往往聚焦于动作,忽视了球员身份,限制了其适用性。虽然某些方法整合额外信息来生成身份感知描述,但由于额外信息独立于视频内容,球员身份有时会不正确。本文提出了一种基于大型语言模型的身份感知篮球视频字幕的球员中心多模态提示生成网络 (LLM-IAVC),其侧重于从视觉角度识别球员身份。具体而言,设计了身份相关信息提取模块 (IRIEM),用于提取球员相关的多模态嵌入。IRIEM 包括用于提取视觉特征和球员姓名的球员识别网络 (PIN) 和用于将球员特征与视频内容关联以相互增强的双向语义交互模块 (BSIM)。此外,设计了视觉上下文学习模块 (VCLM),用于捕获关键视频上下文信息。最后,通过将上述模块的输出整合作为大型语言模型 (LLM) 的多模态提示,促进了生成带球员身份的描述。为支持本工作,我们构建了一个新的基准数据集称为 NBA-Identity,包含 9,726 个涵盖 9 种主要事件类型的身份感知篮球视频字幕数据集。在 NBA-Identity 和 VC-NBA-2022 上的实验结果表明,我们的模型在该任务上实现了先进的性能。代码和数据集已公开提供于 https://github.com/Zeyu1226-mt/LLM-IAVC。

关键词

引用

@article{arxiv.2507.20163,
  title  = {Player-Centric Multimodal Prompt Generation for Large Language Model Based Identity-Aware Basketball Video Captioning},
  author = {Zeyu Xi and Haoying Sun and Yaofei Wu and Junchi Yan and Haoran Zhang and Lifang Wu and Liang Wang and Changwen Chen},
  journal= {arXiv preprint arXiv:2507.20163},
  year   = {2025}
}

备注

Accepted by ICCV 2025 (Poster)