V2A-Mark:用于篡改定位与版权保护的通用深度视音频水印
计算机视觉与模式识别
2024-11-15 v4
摘要
AI 生成视频已经彻底改变了短视频制作、电影制作和个性化媒体,使得视频局部编辑成为一项必不可少的工具。然而,这一进步也模糊了现实与虚构的界限,给多媒体取证带来了挑战。为了解决这一紧迫问题,本文提出了 V2A-Mark,以解决当前视频篡改取证的局限性,如泛化性差、功能单一以及单一模态关注。结合视频到视频隐写的脆弱性与深度鲁棒水印,我们的方法可以将不可见的视音频定位水印和版权水印嵌入到原始视频帧和音频中,从而实现精确的篡改定位和版权保护。我们还设计了时间对齐与融合模块以及退化提示学习,以增强定位精度和解码鲁棒性。同时,我们引入了样本级音频定位方法和跨模态版权提取机制,以耦合音频与视频帧的信息。V2A-Mark 的有效性已在视音频篡改数据集上得到验证,突显了其在定位精度和版权准确性方面的优越性,这对于 AIGC 视频时代视频编辑的可持续发展至关重要。
引用
@article{arxiv.2404.16824,
title = {V2A-Mark: Versatile Deep Visual-Audio Watermarking for Manipulation Localization and Copyright Protection},
author = {Xuanyu Zhang and Youmin Xu and Runyi Li and Jiwen Yu and Weiqi Li and Zhipei Xu and Jian Zhang},
journal= {arXiv preprint arXiv:2404.16824},
year = {2024}
}
备注
Accepted by ACM MM 2024