中文

A$^{2}$V-SLP: 面向解耦手语生成的对齐感知变分建模

机器学习 2026-02-13 v1 计算与语言

摘要

基于近期用于手语生成的结构解耦框架,我们提出了A2^{2}V-SLP,一种对齐感知的变分框架,该框架学习发音器级别的解耦潜在分布,而非确定性嵌入。一个解耦变分自编码器(VAE)对真实手语姿态序列进行编码,并提取发音器特定的均值与方差向量,这些向量作为分布监督信号用于训练非自回归Transformer。给定文本嵌入后,Transformer预测潜在均值和对数方差,而VAE解码器在解码阶段通过随机采样重建最终的手语姿态序列。这种公式通过分布潜在建模避免了确定性潜在坍塌,从而保持了发音器级别的表示。此外,我们整合了一种词汇注意力机制,以加强语言输入与发音运动之间的对齐。实验结果表明,该方法相较于确定性潜在回归取得了持续的性能提升,在完全无词汇标注的设置下实现了最先进的反向翻译性能和更优的运动真实感。

关键词

引用

@article{arxiv.2602.11861,
  title  = {A$^{2}$V-SLP: Alignment-Aware Variational Modeling for Disentangled Sign Language Production},
  author = {Sümeyye Meryem Taşyürek and Enis Mücahid İskender and Hacer Yalim Keles},
  journal= {arXiv preprint arXiv:2602.11861},
  year   = {2026}
}

备注

9 pages, 2 figures, 8 tables