中文

面向同步动作描述的可控注意力Transformer

计算机视觉与模式识别 2024-09-17 v1 计算与语言 机器学习

摘要

本文针对一项具有挑战性的任务——同步动作描述,其目标是生成与人体动作序列同步的语言描述。该任务涉及众多应用,例如对齐手语转录、无监督动作分割和时间定位。我们的方法引入了控制Transformer自注意力和交叉注意力分布的机制,从而实现可解释性和时间对齐的文本生成。我们通过掩码策略和结构化损失来实现这一点,这些损失促使模型仅将注意力最大化集中在对生成动作词贡献最大的关键帧上。这些约束旨在防止注意力图中出现不希望的信息混合,并提供跨词元的单调注意力分布。因此,词元的交叉注意力被用于与人体动作序列同步的渐进式文本生成。我们在两个可用的基准数据集KIT-ML和HumanML3D上的评估证明了我们方法的优越性能。由于可视化评估对此任务至关重要,我们在代码仓库中提供了一套全面的动画视觉图示:https://github.com/rd20karim/Synch-Transformer。

关键词

引用

@article{arxiv.2409.09177,
  title  = {Transformer with Controlled Attention for Synchronous Motion Captioning},
  author = {Karim Radouane and Sylvie Ranwez and Julien Lagarde and Andon Tchechmedjiev},
  journal= {arXiv preprint arXiv:2409.09177},
  year   = {2024}
}