中文

S3Editor:面向人脸视频编辑的稀疏语义解耦自训练框架

计算机视觉与模式识别 2024-04-15 v1 人工智能 计算与语言

摘要

人脸属性编辑在各类应用中发挥着关键作用。然而,现有方法在保持身份特征、编辑保真度以及时间一致性的同时实现高质量结果方面仍面临挑战。这些挑战根源于训练流程中的问题,包括有限的监督、架构设计和优化策略。在本文中,我们提出了 S3Editor,一个用于人脸视频编辑的稀疏语义解耦自训练框架。S3Editor 是一个通用解决方案,通过三个关键贡献全面应对这些挑战。首先,S3Editor 采用自训练范式,通过半监督增强训练过程。其次,我们提出了一种具有动态路由机制的语义解耦架构,以适应多样化的编辑需求。第三,我们提出了一种结构化稀疏优化方案,该方案识别并停用恶意神经元,以进一步解耦非目标属性的影响。S3Editor 与模型无关,且兼容多种编辑方法。我们广泛的定性和定量结果证实,我们的方法显著增强了身份保持、编辑保真度以及时间一致性。

关键词

引用

@article{arxiv.2404.08111,
  title  = {S3Editor: A Sparse Semantic-Disentangled Self-Training Framework for Face Video Editing},
  author = {Guangzhi Wang and Tianyi Chen and Kamran Ghasedi and HsiangTao Wu and Tianyu Ding and Chris Nuesmeyer and Ilya Zharkov and Mohan Kankanhalli and Luming Liang},
  journal= {arXiv preprint arXiv:2404.08111},
  year   = {2024}
}