中文

THInImg:用于图像中呈现说话头部的跨模态隐写

计算机视觉与模式识别 2023-11-30 v1

摘要

跨模态隐写是指将秘密信号不显眼地隐藏在公开可用的覆盖信号(与秘密信号模态不同)中的做法。先前的方法主要集中于隐藏相对较少的信息,而我们提出 THInImg,它利用人脸的特性,成功将长段音频数据(并随后解码出说话头部视频)隐藏在一张身份图像中,可有效用于隐蔽通信、传输和版权保护。THInImg 由编码器和解码器两部分组成。在编码器-解码器流水线中,我们引入了一种新颖的架构,大幅提升了图像中隐藏音频的容量。此外,我们的框架可扩展为迭代地将多段音频片段隐藏进一张身份图像,提供多级权限控制。我们进行了大量实验来证明方法的有效性,表明 THInImg 能在一张 160x160 分辨率的身份图像中呈现长达 80 秒的高质量说话头部视频(含音频)。

关键词

引用

@article{arxiv.2311.17177,
  title  = {THInImg: Cross-modal Steganography for Presenting Talking Heads in Images},
  author = {Lin Zhao and Hongxuan Li and Xuefei Ning and Xinru Jiang},
  journal= {arXiv preprint arXiv:2311.17177},
  year   = {2023}
}

备注

Accepted at WACV 2024