利用音频场景语义的音频注入式自动图像着色
计算机视觉与模式识别
2024-12-19 v2 人工智能
摘要
自动图像着色本质上是一个具有不确定性的不适定问题,需要对场景进行准确的语义理解才能为灰度图像估计合理的颜色。尽管近期基于交互的方法取得了令人瞩目的性能,但在自动着色中推断逼真且准确的颜色仍然是一项非常困难的任务。为了降低灰度场景语义理解的难度,本文尝试利用对应的音频,这些音频自然地包含了同一场景的额外语义信息。具体而言,提出了一种新颖且可插拔的音频注入式自动图像着色(AIAIC)方法,该方法包含三个阶段。首先,我们将彩色图像语义作为桥梁,预训练一个由彩色图像语义引导的着色网络。其次,利用音频和视频的自然共现性来学习音频与视觉场景之间的颜色语义关联。第三,将隐式音频语义表示输入到预训练网络中,最终实现音频引导的着色。整个过程以自监督方式进行训练,无需人工标注。实验表明,音频引导能够有效提升自动着色的性能,特别是对于仅从视觉模态难以理解的一些场景。
引用
@article{arxiv.2401.13270,
title = {Audio-Infused Automatic Image Colorization by Exploiting Audio Scene Semantics},
author = {Pengcheng Zhao and Yanxiang Chen and Yang Zhao and Zhao Zhang},
journal= {arXiv preprint arXiv:2401.13270},
year = {2024}
}
备注
Accepted by ICONIP-2024