中文

DiffSLVA:利用扩散模型实现手语视频匿名化

计算机视觉与模式识别 2023-11-28 v1

摘要

由于美国手语(ASL)没有标准书写形式,聋人手语者频繁分享视频以母语交流。然而,由于手与面部在手语中均传递关键语言信息,手语视频无法保护手语者隐私。尽管手语者出于多种应用表达过对能有效保留语言内容的手语视频匿名化的兴趣,鉴于手部动作与面部表情的复杂性,开发此类技术的尝试成效有限。现有方法主要依赖视频中手语者精确姿态估计,且常需手语视频数据集训练。这些要求使它们难以处理“野外”视频,部分因为当前手语视频数据集多样性有限。为克服这些局限,本研究提出 DiffSLVA,一种利用预训练大规模扩散模型进行零样本文本引导手语视频匿名化的新方法。我们引入 ControlNet,其利用 HED(整体嵌套边缘检测)边缘等低级图像特征,从而避免姿态估计需求。此外,我们开发专用于捕捉面部表情的模块,而面部表情对手语传递关键语言信息至关重要。我们结合上述方法实现更好保留原手语者本质语言内容的匿名化。该创新方法首次使可用于真实世界应用的手语视频匿名化成为可能,将为聋人与重听群体带来显著益处。我们通过一系列手语者匿名化实验展示方法有效性。

关键词

引用

@article{arxiv.2311.16060,
  title  = {DiffSLVA: Harnessing Diffusion Models for Sign Language Video Anonymization},
  author = {Zhaoyang Xia and Carol Neidle and Dimitris N. Metaxas},
  journal= {arXiv preprint arXiv:2311.16060},
  year   = {2023}
}

备注

Project webpage: https://github.com/Jeffery9707/DiffSLVA