从音视频关联中学习视觉风格
计算机视觉与模式识别
2022-05-11 v1 多媒体
声音
音频与语音处理
摘要
从雨点的噼啪声到积雪的嘎吱声,我们听到的声音常传达场景中出现的视觉纹理。本文提出一种从无标注音视频数据中学习视觉风格的方法。我们的模型学习调整场景纹理以匹配声音,我们将此问题称为音频驱动的图像风格化。给定成对的音视频数据集,我们学习对输入图像进行修改,使得修改后它们更可能与给定输入声音共同出现。在定量与定性评估中,我们基于声音的模型优于基于标签的方法。我们还表明音频可作为一种直观的图像操控表示,因为调整声音音量或将两种声音混合会导致视觉风格的可预测变化。项目网页:https://tinglok.netlify.app/files/avstyle
引用
@article{arxiv.2205.05072,
title = {Learning Visual Styles from Audio-Visual Associations},
author = {Tingle Li and Yichen Liu and Andrew Owens and Hang Zhao},
journal= {arXiv preprint arXiv:2205.05072},
year = {2022}
}