中文

从音视频关联中学习视觉风格

计算机视觉与模式识别 2022-05-11 v1 多媒体 声音 音频与语音处理

摘要

从雨点的噼啪声到积雪的嘎吱声,我们听到的声音常传达场景中出现的视觉纹理。本文提出一种从无标注音视频数据中学习视觉风格的方法。我们的模型学习调整场景纹理以匹配声音,我们将此问题称为音频驱动的图像风格化。给定成对的音视频数据集,我们学习对输入图像进行修改,使得修改后它们更可能与给定输入声音共同出现。在定量与定性评估中,我们基于声音的模型优于基于标签的方法。我们还表明音频可作为一种直观的图像操控表示,因为调整声音音量或将两种声音混合会导致视觉风格的可预测变化。项目网页:https://tinglok.netlify.app/files/avstyle

关键词

引用

@article{arxiv.2205.05072,
  title  = {Learning Visual Styles from Audio-Visual Associations},
  author = {Tingle Li and Yichen Liu and Andrew Owens and Hang Zhao},
  journal= {arXiv preprint arXiv:2205.05072},
  year   = {2022}
}