从 360° 空间信息生成可控的音视频视点
多媒体
2025-10-08 v1 人工智能
计算机视觉与模式识别
摘要
音视频视频的生成在扩散模型的出现下取得了显著进展。然而,现有方法往往缺乏对来自更大沉浸式 360 度环境中生成特定视点内容所需的细粒度控制。这一限制阻碍了创建感知非摄像机事件的音视频体验。据我们所知,这是首个引入用于可控音视频生成框架的工作,旨在解决这一未探索的空白。具体而言,我们提出一种扩散模型,通过引入一组来自完整 360 度空间的强大条件信号:用于识别感兴趣区域的全景显著性图、用于定义目标视点的带包围盒感知距离图,以及描述整个场景的描述性说明。通过整合这些控制信号,我们的模型生成受更广泛、不可见环境上下文影响的具有空间感知性的视点视频与音频,引入了对真实沉浸式音视频生成至关重要的强可控性。我们展示的音视频示例证明了该框架的有效性。
引用
@article{arxiv.2510.06060,
title = {Controllable Audio-Visual Viewpoint Generation from 360{\deg} Spatial Information},
author = {Christian Marinoni and Riccardo Fosco Gramaccioni and Eleonora Grassucci and Danilo Comminiello},
journal= {arXiv preprint arXiv:2510.06060},
year = {2025}
}