TV-Dialogue:利用沉浸式互动构建主题感知视频对话
计算机视觉与模式识别
2025-02-03 v1
摘要
近期大语言模型的发展加速了跨文本和图像的对话生成,但基于视频的对话生成仍未得到充分探索,存在独特挑战。本文引入主题感知视频对话创作(TVDC)这一新任务,旨在生成与视频内容一致且遵循用户指定主题的新对话。我们提出了TV-Dialogue,这一一种新型多模态代理框架,通过使视频角色之间实现实时沉浸式互动,确保主题对齐(即对话围绕主题展开)和视觉一致性(即对话与视频中角色的情绪和行为相匹配),从而准确理解视频内容并生成与给定主题相匹配的新对话。为评估生成的对话,我们提出了一种多粒度评估基准,具有高准确性、可解释性和可靠性,表明TV-Dialogue在自收集数据集上的有效性优于直接使用现有LLM。大量实验表明,TV-Dialogue能够以零样本方式为任意长度和任意主题的视频生成对话。我们的发现凸显了TV-Dialogue在诸多应用中的潜力,如视频重制、电影配音及其在下游多模态任务中的应用。
引用
@article{arxiv.2501.18940,
title = {TV-Dialogue: Crafting Theme-Aware Video Dialogues with Immersive Interaction},
author = {Sai Wang and Fan Ma and Xinyi Li and Hehe Fan and Yu Wu},
journal= {arXiv preprint arXiv:2501.18940},
year = {2025}
}