基于多模态大语言模型的实时游戏视频解说生成:停顿感知解码方法
计算与语言
2026-03-04 v1 人工智能
摘要
实时视频解说生成为正在进行的视频事件提供文本描述。它支持诸如体育、电子竞技和直播等领域的可访问性和参与度。解说生成涉及两个基本决策:说什么以及何时说。虽然最近的基于提示的做法使用多模态大语言模型(MLLM)在内容生成方面表现出色,但它们大多忽视了时机问题。我们研究仅通过 in-context 提示是否能支持既在语义上相关又在时机上恰当的实时解说生成。我们提出两种基于提示的解码策略:1)固定间隔方法,和2)一种 novel 基于动态间隔的解码方法,该方法根据估计的前一句话时长调整下一句预测的时机。两种方法均无需任何微调即可实现停顿感知生成。在日语和英语的赛车和格斗游戏数据集上实验表明,基于动态间隔的解码方法仅通过提示即可生成更贴近人类说话时机和内容的解说。我们发布了多语言基准数据集、训练好的模型和实现,以支持未来研究实时视频解说生成。
引用
@article{arxiv.2603.02655,
title = {Real-Time Generation of Game Video Commentary with Multimodal LLMs: Pause-Aware Decoding Approaches},
author = {Anum Afzal and Yuki Saito and Hiroya Takamura and Katsuhito Sudoh and Shinnosuke Takamichi and Graham Neubig and Florian Matthes and Tatsuya Ishigaki},
journal= {arXiv preprint arXiv:2603.02655},
year = {2026}
}
备注
Accepted at LREC2026