中文

Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods

机器学习 2025-08-01 v1 人工智能 计算机视觉与模式识别 声音 音频与语音处理

摘要

本文探讨了多模态潜在空间的逆向能力及其在任务特定 AI 模型中的更广泛用途。虽然这些模型在设计的正向任务(如文本到图像生成、语音到文本转录)中表现出色,但其用于逆向映射的潜力基本未被探索。我们提出了一种基于优化的框架,从期望的输出中推断输入特征,在文本-图像(BLIP、Flux.1-dev)和文本-音频(Whisper-Large-V3、Chatterbox-TTS)模态之间进行双向应用。我们的核心假设是:尽管优化可以指导模型完成逆向任务,但其多模态潜在空间不会始终支持语义上有意义且感知上连贯的逆向映射。实验结果一致验证了这一假设。我们展示了,尽管优化可以迫使模型产生与目标文本一致的输出(例如,文本到图像模型生成的图像可被图像描述模型正确描述,或语音识别模型准确转录优化后的音频),但这些逆向操作的感知质量是混乱且缺乏连贯性的。此外,在尝试从生成模型中推断原始语义输入时,重建的潜在空间嵌入经常缺乏语义可解释性,与无意义的词汇标记相吻合。这些发现凸显了关键局限性:主要针对特定正向任务优化的多模态潜在空间,不具备用于稳健且可解释逆向映射所需的结构。我们的工作强调了进一步研究开发真正语义丰富且可逆多模态潜在空间的必要性。

关键词

引用

@article{arxiv.2507.23010,
  title  = {Investigating the Invertibility of Multimodal Latent Spaces: Limitations of Optimization-Based Methods},
  author = {Siwoo Park},
  journal= {arXiv preprint arXiv:2507.23010},
  year   = {2025}
}