penny-wise 与 pound-foolish 深度伪造检测中的困境
计算机视觉与模式识别
2024-08-19 v1
摘要
深度伪造技术的不断扩散引发了关于其在各个领域潜在滥用所带来的严重担忧,促使亟需提供稳健的检测方法。尽管已有进展,但许多当前方法却以短期收益为导向,牺牲长期有效性。本文批判了仅凭 penny-wise 目标在单个深度伪造数据集上对预训练模型进行精细调优的过度专业化方法,同时忽视了针对泛化性和知识保留的 pound-wise 平衡。为解决此 "penny-wise 与 pound-foolish" 问题,本文提出了一种新颖的学习框架(PoundNet),用于预训练视觉语言模型上深度伪造检测的泛化。PoundNet 融合可学习的提示设计与平衡目标,既保留了上游任务(对象分类)的广泛知识,又增强了下游任务(深度伪造检测)的泛化能力。我们在标准单个深度伪造数据集上训练 PoundNet,遵循文献中常见的做法。随后我们在10个公开大型深度伪造数据集上进行评估,采用5个主要评估指标——据我们了解,这是评估深度伪造检测模型泛化能力最大的基准测试集合。综合基准评估表明,提出的 PoundNet 显著小于 "penny-wise 与 pound-foolish",在深度伪造检测性能上相较于最先进的方法实现了约19%的显著提升,同时保持了63%的对象分类性能,其中其他深度伪造检测模型往往无效。代码和数据已开源于 https://github.com/iamwangyabin/PoundNet。
引用
@article{arxiv.2408.08412,
title = {Penny-Wise and Pound-Foolish in Deepfake Detection},
author = {Yabin Wang and Zhiwu Huang and Su Zhou and Adam Prugel-Bennett and Xiaopeng Hong},
journal= {arXiv preprint arXiv:2408.08412},
year = {2024}
}