中文

SignDPO:基于骨架的无词典手语翻译的多层次直接偏好优化

计算与语言 2026-04-21 v1 计算机视觉与模式识别

摘要

我们提出SignDPO,这是一个 Novel 的多层次 Direct Preference Optimisation (DPO) 框架,用于提升基于骨架的手语翻译对齐性。虽然当前基于骨架的模型在使用最大似然估计方面取得了显著进展,但它们主要受限于仿照式范式,缺乏对手语细粒度时空细微差异的判别敏感性,常导致语义漂移。为此,SignDPO 将优化目标从简单的序列仿照转向在空间、时间和语言维度上进行结构化偏好对齐。我们的框架包含三个关键设计。首先,我们引入分层扰动策略,自动在全局和局部粒度上构建空间和时间非优取样。其次,我们提出一种自导向机制,利用解码器的交叉注意力得分识别和扰动语义关键骨骼区域,迫使模型区分真实手势信号与结构性扰动。最后,我们通过微调专门的扰动模型建立自动化的语言级偏好生成器,捕捉输出层复杂的失败模式,无需人工标注。对三组广泛使用的基准数据集(CSL-Daily、How2Sign 和 OpenASL)进行的大量实验表明,SignDPO 在对比最新的无词典方法时始终显著优于 SOTA 方法,甚至与 established 的基于词典方法相媲美。我们的结果表明,多层次偏好对齐是一种强大的范式,能够弥合高熵骨架轨迹与离散语言语义之间的差距。

关键词

引用

@article{arxiv.2604.18034,
  title  = {SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation},
  author = {Muxin Pu and Xiao-Ming Wu and Mei Kuan Lim and Chun Yong Chong and Wei Li and Chen Change Loy},
  journal= {arXiv preprint arXiv:2604.18034},
  year   = {2026}
}