中文

LaTo:用于细粒度人脸编辑的标记化扩散Transformer

计算机视觉与模式识别 2026-01-30 v2

摘要

近期基于指令的人脸编辑多模态模型实现了语义操作,但在精确属性控制和身份保持方面仍存在困难。诸如关键点之类的结构化面部表示对于中间监督是有效的,然而大多数现有方法将其视为刚性几何约束,当条件关键点与源图像显著偏离时(例如,大的表情或姿态变化、不准确的关键点估计),这可能会降低身份保真度。为了解决这些局限性,我们提出了LaTo,一种用于细粒度、保持身份的人脸编辑的标记化扩散Transformer。我们的关键创新包括:(1)一个关键点标记器,直接将原始关键点坐标量化为离散的面部令牌,从而无需密集的像素级对应;(2)一种位置映射的位置编码和一种关键点感知的无分类器引导,它们共同促进了指令、几何形状和外观之间灵活且解耦的交互,实现了强大的身份保持;以及(3)一个关键点预测器,利用视觉-语言模型从指令和源图像中推断目标关键点,其结构化的思维链提高了估计准确性和交互式控制。为了缓解数据稀缺问题,我们策划了HFL-150K数据集,据我们所知,这是该任务最大的基准,包含超过15万对带有细粒度指令的真实人脸对。大量实验表明,LaTo在身份保持方面比最先进的方法高出7.8%,在语义一致性方面高出4.6%。代码和数据集将在接收后公开。

关键词

引用

@article{arxiv.2509.25731,
  title  = {LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing},
  author = {Zhenghao Zhang and Ziying Zhang and Junchao Liao and Xiangyu Meng and Qiang Hu and Siyu Zhu and Xiaoyun Zhang and Long Qin and Weizhi Wang},
  journal= {arXiv preprint arXiv:2509.25731},
  year   = {2026}
}