LiveChat:基于音视频多模态上下文的视频评论生成
计算机视觉与模式识别
2023-11-23 v1 人工智能
摘要
视频实时评论是直播平台的一项流行功能,使观众能够在观看视频或直播时与内容互动,并向主播或其他观众分享评论、反应、观点或问题。它为AI智能体提供了一个具有挑战性的测试平台,涉及同时理解来自直播流的音视频多模态上下文,以及通过对话与人类观众交互的能力。由于现有基于直播的评论数据集类别有限且缺乏多样性,我们构建了一个大规模音视频多模态对话数据集以推动实时评论技术的发展。数据收集自Twitch,包含11个不同类别和575名主播,总计438小时视频和320万条评论。此外,我们提出了一种新颖的多模态生成模型,能够生成与视频内时空事件以及正在进行中的多模态对话上下文相对齐的实时评论。我们的初步结果已证明所提模型的有效性,为进一步研究和直播视频交互领域的实际应用提供了坚实基础。
引用
@article{arxiv.2311.12826,
title = {LiveChat: Video Comment Generation from Audio-Visual Multimodal Contexts},
author = {Julien Lalanne and Raphael Bournet and Yi Yu},
journal= {arXiv preprint arXiv:2311.12826},
year = {2023}
}