基于StyleGAN先验的可扩展人脸图像编码:面向人机协同视觉的压缩
计算机视觉与模式识别
2023-12-27 v1 人工智能
多媒体
摘要
视觉内容的加速激增和机器视觉技术的快速发展给大规模视觉数据传输带来了重大挑战,这些数据需要被有效表示以满足人类和机器的需求。本文研究了如何利用从先进生成先验中导出的分层表示来构建高效的可扩展编码范式,用于人机协同视觉。我们的关键见解是:通过利用StyleGAN先验,可以学习编码分层语义的三层表示,这些表示被精心设计为基础层、中间层和增强层,以渐进方式支持机器智能和人类视觉感知。为实现高效压缩,我们提出了逐层可扩展熵变换器以减少层间冗余。基于多任务可扩展率失真目标,所提方案被联合优化以实现最优的机器分析性能、人类感知体验和压缩比。我们验证了该范式在人脸图像压缩中的可行性。大量定性和定量实验结果表明,在极低比特率( bpp)下,所提范式在机器分析和人类感知方面均优于最新压缩标准Versatile Video Coding(VVC),为人机协同压缩提供了新见解。
引用
@article{arxiv.2312.15622,
title = {Scalable Face Image Coding via StyleGAN Prior: Towards Compression for Human-Machine Collaborative Vision},
author = {Qi Mao and Chongyu Wang and Meng Wang and Shiqi Wang and Ruijie Chen and Libiao Jin and Siwei Ma},
journal= {arXiv preprint arXiv:2312.15622},
year = {2023}
}
备注
Accepted by IEEE TIP