中文

从视觉到听觉:图像引导的场景声音化

音频与语音处理 2024-02-05 v1 声音

摘要

图像、视频、文本和音频生成技术的最新进展及其在公众中的使用,正在催生新形式的内容生成。通常,每种模态都被单独处理,这带来了局限性。视觉序列的自动声音录制是多模态内容自动生成的最大挑战之一。我们提出了一种处理流程,该流程从视频中提取的图像出发,能够为其配上声音。我们使用预训练模型,这些模型采用复杂的编码器、对比学习和多种模态,能够对序列进行复杂的表示以实现其声音化。所提出的方案为音频映射和文本引导提供了不同的可能性。我们在一个从商业视频游戏中提取的帧和从Freesound平台提取的声音组成的数据集上评估了该方案。主观测试表明,所提出的方案能够自动且恰当地为图像生成并分配音频。此外,它能很好地适应用户偏好,并且所提出的客观指标与主观评分显示出高度相关性。

关键词

引用

@article{arxiv.2402.01385,
  title  = {Del Visual al Auditivo: Sonorizaci\'on de Escenas Guiada por Imagen},
  author = {María Sánchez and Laura Fernández and Julián Arias and Mateo Cámara and Giulia Comini and Adam Gabrys and José Luis Blanco and Juan Ignacio Godino and Luis Alfonso Hernández},
  journal= {arXiv preprint arXiv:2402.01385},
  year   = {2024}
}

备注

10 pages, in Spanish, Tecniac\'ustica