基于语义帧聚合的直播视频评论生成Transformer模型
计算机视觉与模式识别
2025-11-03 v1 计算与语言
摘要
直播视频评论在像 Twitch 这样的平台上呈 explosive growth,通过动态交互增强观众参与度。然而,自动生成语境恰当的评论仍是一个具有挑战性和吸引力的任务。视频流可能包含大量数据和不相关内容。现有方法往往忽视了优先考虑与 ongoing 观众交互最相关的视频帧这一重要方面。这种优先级排序对于产生语境恰当的评论至关重要。为解决这一问题,我们引入了一种新的语义帧聚合基于Transformer的模型(SFAT),用于直播视频评论生成。该方法不仅利用 CLIP 的视觉-文本多模态知识生成评论,还根据其与 ongoing 观众对话的语义相关性为视频帧分配权重。它采用高效的加权求和帧技术,以强调信息丰富的帧,同时对无关的帧关注较少。最后,我们的带跨注意力机制的评论解码器注意每个模态,确保生成的评论反映了来自聊天和视频的语境线索。此外,为了解决现有数据集主要聚焦中文语言内容且视频类别有限的局限性,我们构建了一个大规模、多样化的英文视频评论数据集。该数据集源自 Twitch,覆盖 11 个视频类别,总计 438 小时和 320 万条评论。我们通过与现有方法进行比较,展示了我们的 SFAT 模型在从直播视频和 ongoing 对话语境中生成评论方面的有效性。
引用
@article{arxiv.2510.26978,
title = {Semantic Frame Aggregation-based Transformer for Live Video Comment Generation},
author = {Anam Fatima and Yi Yu and Janak Kapuriya and Julien Lalanne and Jainendra Shukla},
journal= {arXiv preprint arXiv:2510.26978},
year = {2025}
}