中文

深度学习与合成媒体

机器学习 2022-05-13 v1 声音 音频与语音处理

摘要

深度学习算法正在迅速改变视听媒体的制作方式。利用深度学习生成的合成视听媒体——通常通俗地归为“deepfakes(深度伪造)”一词之下——具有若干令人瞩目的特征:它们越来越易于制作,并且可能与传感器记录的真实声音和图像无法区分。大量关注集中于这一技术发展引发的伦理担忧。在此,我转而关注与合成视听媒体概念相关的一组问题、它在更宽泛的视听媒体分类体系中的位置,以及深度学习技术与更传统的媒体合成方法之间的差异。在回顾用于媒体操纵与生成的深度学习流水线的关键成因特征后,我认为此类流水线产出的“deepfakes”及相关合成媒体不仅仅是对先前方法的渐进式改进,而是挑战了传统的分类学区分,并为真正新颖的视听媒体类型铺平了道路。

关键词

引用

@article{arxiv.2205.05764,
  title  = {Deep Learning and Synthetic Media},
  author = {Raphaël Millière},
  journal= {arXiv preprint arXiv:2205.05764},
  year   = {2022}
}

备注

Forthcoming in Synthese (please cite published version)