中文

KAN 文本到视觉?基于 Kolmogorov-Arnold Networks 从手语符号生成多尺度序列姿态动画的探索

计算机视觉与模式识别 2026-05-12 v1 人工智能 多媒体

摘要

从符号表示生成手语为可访问的手语动画提供了一条可扩展的途径。我们提出了 KANMultiSign,一种将 HamNoSys 符号转化为二维人体姿态序列的多尺度序列生成器。我们的框架做出了两项互补的贡献。首先,我们引入了具有多尺度监督的由粗到细生成策略:模型首先由中间的躯干-手部-面部支架引导,以促进全局结构一致性,随后细化细粒度的手部关节,以提升手指级细节。其次,我们研究将 Kolmogorov-Arnold Network 模块集成到 Transformer 主干中,利用可学习的单变量函数基元,以紧凑的参数化对从离散音素符号到连续躯体运动学的高度非线性映射进行建模。在涵盖波兰语、德语、希腊语和法语手语的多个公共语料库上的实验表明,与强大的符号到姿态基线相比,基于动态时间规整的关节误差持续降低,且使用的参数大幅减少。受控消融实验进一步表明,与多尺度监督相结合时,基于 KAN 的变体在保持竞争力的同时显著减少了参数量,而非作为准确率提升的主要驱动力。这些发现将多尺度监督定位为改进符号条件姿态生成的关键机制,而 KAN 则为高效建模提供了一种紧凑的替代方案。我们的代码将公开发布。

关键词

引用

@article{arxiv.2605.09572,
  title  = {KAN Text to Vision? The Exploration of Kolmogorov-Arnold Networks for Multi-Scale Sequence-Based Pose Animation from Sign Language Notation},
  author = {Guanyi Du and Lintao Wang and Kun Hu and Ziyang Wang},
  journal= {arXiv preprint arXiv:2605.09572},
  year   = {2026}
}

备注

Accepted at Neurocomputing