PersonaVlog:基于多智能体协作与迭代自纠正的个性化多模态 Vlog 生成
计算机视觉与模式识别
2025-09-03 v2
摘要
随着短视频和个性化内容需求的增长,自动化视频日志(Vlog)生成已成为多模态内容创建的关键方向。现有方法大多依赖预定义脚本,缺乏动态性和个人表达。因此,迫切需要一种自动化 Vlog 生成方法,以实现有效的多模态协作和高个人化。为此,我们提出了 PersonaVlog,一个能够基于给定主题和参考图像生成具有个人化特征的 Vlog 的自动化多模态风格化 Vlog 生成框架,包括视频、背景音乐和内心独白语音。具体而言,我们提出了一个基于多模态大语言模型(Multimodal Large Language Models, MLLMs)的多智能体协作框架。该框架根据用户输入高效生成用于多模态内容创建的高质量提示,从而提高了流程的效率和创造力。此外,我们还包含一个反馈和回滚机制,利用 MLLMs 对生成结果进行评估和反馈,从而实现多模态内容的迭代自我纠正。我们还提出了 ThemeVlogEval,一个基于主题的自动化基准框架,提供标准化的指标和数据集,以进行公平评估。综合实验表明,我们的方法在多个基线上具有显著优势和潜力,突显了其有效性和在自动化 Vlog 生成方面的巨大潜力。
引用
@article{arxiv.2508.13602,
title = {PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction},
author = {Xiaolu Hou and Bing Ma and Jiaxiang Cheng and Xuhua Ren and Kai Yu and Wenyue Li and Tianxiang Zheng and Qinglin Lu},
journal= {arXiv preprint arXiv:2508.13602},
year = {2025}
}
备注
Project Page: https://personavlog-paper.github.io/