深度学习与合成媒体
机器学习
2022-05-13 v1 声音
音频与语音处理
摘要
深度学习算法正在迅速改变视听媒体的制作方式。利用深度学习生成的合成视听媒体——通常通俗地归为“deepfakes(深度伪造)”一词之下——具有若干令人瞩目的特征:它们越来越易于制作,并且可能与传感器记录的真实声音和图像无法区分。大量关注集中于这一技术发展引发的伦理担忧。在此,我转而关注与合成视听媒体概念相关的一组问题、它在更宽泛的视听媒体分类体系中的位置,以及深度学习技术与更传统的媒体合成方法之间的差异。在回顾用于媒体操纵与生成的深度学习流水线的关键成因特征后,我认为此类流水线产出的“deepfakes”及相关合成媒体不仅仅是对先前方法的渐进式改进,而是挑战了传统的分类学区分,并为真正新颖的视听媒体类型铺平了道路。
引用
@article{arxiv.2205.05764,
title = {Deep Learning and Synthetic Media},
author = {Raphaël Millière},
journal= {arXiv preprint arXiv:2205.05764},
year = {2022}
}
备注
Forthcoming in Synthese (please cite published version)