中文

一石二鸟:图像与视频风格迁移联合学习的统一框架

计算机视觉与模式识别 2023-09-06 v2

摘要

当前任意风格迁移模型仅限于图像或视频单一领域。为获得满意的图像与视频风格迁移,不可避免地需要两个不同模型并分别在图像与视频域上独立训练。本文表明,可通过引入 UniST(一种面向图像与视频的统一风格迁移框架)来避免这一点。UniST 的核心是一个域交互 transformer(DIT),其先在特定域内探索上下文信息,再交互上下文化的域信息以进行联合学习。特别地,DIT 能利用视频中的时序信息服务于图像风格迁移任务,同时允许来自图像的丰富外观纹理用于视频风格迁移,从而带来互利。考虑到传统多头自注意力计算繁重,我们为 DIT 提出一种简洁而有效的轴向多头自注意力(AMSA),在保持风格迁移性能的同时提升计算效率。为验证 UniST 的有效性,我们在图像与视频风格迁移任务上进行了充分实验,表明 UniST 在两项任务上均优于最先进方法。代码见 https://github.com/NevSNev/UniST。

关键词

引用

@article{arxiv.2304.11335,
  title  = {Two Birds, One Stone: A Unified Framework for Joint Learning of Image and Video Style Transfers},
  author = {Bohai Gu and Heng Fan and Libo Zhang},
  journal= {arXiv preprint arXiv:2304.11335},
  year   = {2023}
}

备注

Conference on International Conference on Computer Vision.(ICCV 2023)