手语深度伪造的生成与检测——语言与视觉分析
计算机视觉与模式识别
2025-02-18 v2 人工智能
摘要
本研究探索了深度伪造技术在上半身生成中的积极应用,特别是针对聋哑和听障(DHoH)社区的手语。鉴于手语的复杂性和专家的稀缺性,生成的视频由手语专家进行准确性审查。我们构建了一个可靠的深度伪造数据集,使用计算机视觉和自然语言处理模型评估其技术和视觉可信度。该数据集包含超过1200个视频,涵盖见过和未见过的个体,也用于检测针对弱势个体的深度伪造视频。专家注释确认生成的视频与真实手语内容相当。使用文本相似度评分和口译员评估的语言分析表明,生成视频的解释与真实手语至少90%相似。视觉分析表明,即使对于新对象,也能产生令人信服的逼真深度伪造。使用姿态/风格迁移模型,我们密切关注细节,确保手部动作准确并与驱动视频对齐。我们还应用机器学习算法在此数据集上建立深度伪造检测的基线,有助于检测欺诈性手语视频。
引用
@article{arxiv.2404.01438,
title = {Generation and Detection of Sign Language Deepfakes - A Linguistic and Visual Analysis},
author = {Shahzeb Naeem and Muhammad Riyyan Khan and Usman Tariq and Abhinav Dhall and Carlos Ivan Colon and Hasan Al-Nashash},
journal= {arXiv preprint arXiv:2404.01438},
year = {2025}
}
备注
10 pages, 11 figures, IEEE TRANSACTIONS ON COMPUTATIONAL SOCIAL SYSTEM