中文

基于多智能体协作的长视频音频合成

计算机视觉与模式识别 2025-03-18 v2

摘要

视频到音频合成为视觉内容生成同步音频,关键性地提升了观众的沉浸感和叙事连贯性。然而,针对长篇内容的视频到音频dubbing仍是未解决的挑战,由于动态语义变化、时序错位以及缺乏专门数据集。虽然现有方法在短视频中表现出色,但在长场景(如电影)中因碎片化合成和跨场景一致性不足而难以胜任。我们提出LVAS-Agent,一种新颖的多智能体框架,通过协作角色专化来模拟专业dubbing工作流程。我们的方法将长视频合成分解为四个步骤:场景分割、脚本生成、声设计和音频合成。核心创新包括用于场景/脚本细化的讨论-纠正机制以及用于时序-语义对齐的生成-检索循环。为实现系统评估,我们引入LVAS-Bench,首个包含207个专业精选长视频的基准,涵盖多样化场景。实验表明,我们的方法在基线方法上实现了优异的音视频对齐。项目页面:https://lvas-agent.github.io

关键词

引用

@article{arxiv.2503.10719,
  title  = {Long-Video Audio Synthesis with Multi-Agent Collaboration},
  author = {Yehang Zhang and Xinli Xu and Xiaojie Xu and Li Liu and Yingcong Chen},
  journal= {arXiv preprint arXiv:2503.10719},
  year   = {2025}
}