中文

深度学习与压缩的第一性原理

图像与视频处理 2022-04-06 v1 计算机视觉与模式识别 机器学习 机器学习

摘要

2012 年 Alexnet 论文引发的深度学习革命已对计算机视觉领域产生变革性影响。许多受限于经典方法的难题如今取得了前所未有的成功。深度学习方法的迅速扩散导致其在消费与嵌入式应用中的使用急剧增加。消费与嵌入式应用的一个后果是必须有损多媒体压缩,以在这些现实场景中实现数据的高效存储与传输。因此,人们对用于多媒体压缩的深度学习方案兴趣日增,该方案可实现更高压缩比与更佳视觉质量。这种多媒体压缩的深度学习路径,即所谓学习型多媒体压缩,利用深度网络作为编码器与解码器来计算图像或视频的压缩表示。尽管这些技术在学术上取得令人瞩目的成功,其工业采纳几乎为零。JPEG 与 MPEG 等经典压缩技术在现代计算中根基过深,难以轻易取代。本学位论文采取正交思路,利用深度学习提升这些经典算法的压缩保真度。这使得深度学习的惊人进展可用于多媒体压缩,同时不威胁经典方法的普适性。本工作的关键洞见是:由第一性原理(即压缩算法开发时所做的底层工程决策)驱动的方法比通用方法更有效。通过将先验知识编码进算法设计,以通用性为代价改善了灵活性、性能和/或精度……

关键词

引用

@article{arxiv.2204.01782,
  title  = {The First Principles of Deep Learning and Compression},
  author = {Max Ehrlich},
  journal= {arXiv preprint arXiv:2204.01782},
  year   = {2022}
}

备注

Doctoral Dissertation, more information at https://maxehr.umiacs.io/dissertation