基于轨迹引导的音视频生成带物理一致性
计算机视觉与模式识别
2026-04-17 v2 多媒体
声音
摘要
音视频 (AV) 生成近期在感知质量和多模态一致性方面取得了显著进展,但生成具有可信运动-声音关系的内容仍具挑战性。现有方法常产生视觉不稳定的物体运动和仅与显著运动或接触事件松散对齐的声音,主要原因在于缺乏用于视频和声音生成的显式运动感知结构。我们提出 Tora3,一个轨迹引导的 AV 生成框架,通过将物体轨迹作为共享的运动先验来提高物理一致性。不同于将轨迹仅当作视频控制信号,Tora3 使用轨迹联合指导视觉运动和声学事件。具体而言,我们设计了用于视频的轨迹对齐运动表示、由轨迹导出的二阶运动状态驱动的运动-声学对齐模块,以及保持轨迹条件区域内轨迹忠诚度同时在其他区域保持局部一致性的混合流匹配方案。我们进一步策划了 PAV 数据集,强调以运动相关模式为中心,并自动提取运动注释。广泛实验表明,Tora3 在运动真实性、运动-声音同步以及整体 AV 生成质量方面均优于强大的开源基线。
引用
@article{arxiv.2604.09057,
title = {Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence},
author = {Junchao Liao and Zhenghao Zhang and Xiangyu Meng and Litao Li and Ziying Zhang and Siyu Zhu and Long Qin and Weizhi Wang},
journal= {arXiv preprint arXiv:2604.09057},
year = {2026}
}
备注
12 pages, 5 tables, 5 figures