中文

MACS:具有上下文显著性与语义对齐的多源音频到图像生成

声音 2025-12-11 v3 计算机视觉与模式识别 图形学 音频与语音处理

摘要

随着深度生成模型的突破,音频到图像生成已成为一个关键的跨模态任务,将复杂的听觉信号转换为丰富的视觉表示。然而,此前的工作仅关注单源音频输入进行图像生成,忽略了自然听觉场景中的多源特性,从而限制了生成全面视觉内容的能力。为弥补这一差距,我们提出了一种名为 MACS 的方法用于多源音频到图像生成。据我们所知,这是首个明确分离多源音频以在图像生成前捕捉丰富音频成分的工作。MACS 是一个两阶段方法。在第一阶段,多源音频输入通过弱监督方法分离,其中音频和文本标签通过使用大规模预训练的 CLAP 模型投射到共同空间实现语义对齐。我们引入排序损失以考虑分离音频信号的上下文显著性。在第二阶段,通过仅使用一个可训练适配器和多层感知机层将分离的音频信号映射到生成条件,实现有效的图像生成。我们将 LLP 数据集预处理为首个完整的多源音频到图像生成基准。实验在多源、混合源和单源音频到图像生成任务上进行。提出的 MACS 在所有任务的 21 个评估指标中,有 17 个超越了当前最先进方法,并提供了优越的视觉质量。

关键词

引用

@article{arxiv.2503.10287,
  title  = {MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment},
  author = {Hao Zhou and Xiaobao Guo and Yuzhe Zhu and Adams Wai-Kin Kong},
  journal= {arXiv preprint arXiv:2503.10287},
  year   = {2025}
}

备注

Accepted at AAAI 2026. Code available at https://github.com/alxzzhou/MACS