中文

FoleyGRAM:基于GRAM对齐的多模态编码器视频到音频生成

声音 2025-10-08 v1 计算机视觉与模式识别 机器学习 多媒体 音频与语音处理

摘要

本文提出 FoleyGRAM,一种强调通过对齐多模态编码器实现语义条件控制的视频到音频生成方法。基于对视频到音频生成的先前进展,FoleyGRAM 利用 Gramian Representation Alignment Measure (GRAM) 对齐视频、文本和音频模态的嵌入向量,实现对音频生成过程的精确语义控制。FoleyGRAM 的核心是基于 GRAM 对齐嵌入和波形包络条件的扩散式音频合成模型,确保语义丰富性与对应输入视频的时间对齐。我们在最常用的 Greatest Hits 数据集上评估了 FoleyGRAM。我们的实验表明,使用 GRAM 对齐多模态编码器可增强系统对生成音频与视频内容语义对齐的能力,推动了视频到音频合成的技术发展。

关键词

引用

@article{arxiv.2510.05829,
  title  = {FoleyGRAM: Video-to-Audio Generation with GRAM-Aligned Multimodal Encoders},
  author = {Riccardo Fosco Gramaccioni and Christian Marinoni and Eleonora Grassucci and Giordano Cicchetti and Aurelio Uncini and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2510.05829},
  year   = {2025}
}

备注

Acepted at IJCNN 2025