SeeingSounds:通过文本学习音频到视觉对齐
声音
2025-10-15 v1 人工智能
计算机视觉与模式识别
多媒体
摘要
我们提出了 SeeingSounds,一个轻量且模块化的框架,用于音频到图像生成,利用音频、语言和视觉之间的相互作用——无需任何配对音视频数据或在视觉生成模型上的训练。不同于将音频用作文本替代品或仅依赖音频到文本映射的方法,我们的方法进行双向对齐:音频通过冻结语言编码器投射到语义语言空间,并通过基于语境的视觉语言模型在视觉领域中实现上下文对齐。这种方法灵感来自认知神经科学,反映了人类感知中所观察到的自然跨模态关联。该模型 operates on 冻结扩散 backbone,仅训练轻量适配器,实现高效可扩展的学习。此外,它支持通过程序化文本提示生成实现细粒度可解释控制,其中音频变换(如音量或音调变化)翻译为描述性提示(如"远处的雷声"),引导视觉输出。广泛实验表明,SeeingSounds 在零样本和监督设置下均优于现有方法,在可控音频到视觉生成方面树立了新的状态。
引用
@article{arxiv.2510.11738,
title = {SeeingSounds: Learning Audio-to-Visual Alignment via Text},
author = {Simone Carnemolla and Matteo Pennisi and Chiara Russo and Simone Palazzo and Daniela Giordano and Concetto Spampinato},
journal= {arXiv preprint arXiv:2510.11738},
year = {2025}
}
备注
accepted to ACM Multimedia Asia 2025