鲁棒的声音引导图像操控
计算机视觉与模式识别
2023-04-26 v3
摘要
近期的成功表明,图像可通过文本提示进行操控,例如,晴天下的景观场景通过文本输入“下雨”被操控为同一场景下的雨天。这些方法通常利用基于StyleCLIP的图像生成器,其借助多模态(文本与图像)嵌入空间。然而,我们观察到此类文本输入在提供与合成丰富语义线索方面常存在瓶颈,例如难以区分大雨与伴有雷暴的降雨。为解决此问题,我们主张引入另一种模态——声音,其在图像操控中具有显著优势,因为相比文本,声音能传达更多样的语义线索(生动情感或自然世界的动态表达)。本文中,我们提出一种新方法,首先将图像-文本联合嵌入空间扩展至声音,并应用直接潜变量优化方法基于音频输入(如雨声)操控给定图像。我们的大量实验表明,我们的声音引导图像操控方法比最先进的文本与声音引导图像操控方法在语义与视觉上产生更合理的操控结果,这进一步被我们的人工评估所证实。我们的下游任务评估也表明,我们学习的图像-文本-声音联合嵌入空间有效地编码了声音输入。
引用
@article{arxiv.2208.14114,
title = {Robust Sound-Guided Image Manipulation},
author = {Seung Hyun Lee and Gyeongrok Oh and Wonmin Byeon and Sang Ho Yoon and Jinkyu Kim and Sangpil Kim},
journal= {arXiv preprint arXiv:2208.14114},
year = {2023}
}
备注
arXiv admin note: text overlap with arXiv:2112.00007