中文

SignAttention:Transformer模型用于手语翻译的可解释性分析

计算与语言 2024-10-21 v1 人工智能

摘要

本文首次对基于Transformer的手语翻译(SLT)模型进行全面可解释性分析,聚焦于将视频形式的希腊手语翻译为gloss和文本。我们利用希腊手语数据集,检视模型中注意力机制的工作方式,以理解其如何处理并对齐视觉输入与序列gloss。我们的分析表明,模型关注的是帧的聚类而非单个帧,随着gloss数量增加,肢体与gloss之间的对齐模式呈现出对角线特征,但这一特征变得不那么明显。我们还探讨了跨注意力和自注意力在每个解码步骤中的相对贡献,发现模型最初依赖视频帧,但在翻译推进过程中逐渐转向关注先前预测的记号。这一工作深化了对SLT模型的理解,为开发更透明可靠的翻译系统铺平了为实际应用所需的道路。

关键词

引用

@article{arxiv.2410.14506,
  title  = {SignAttention: On the Interpretability of Transformer Models for Sign Language Translation},
  author = {Pedro Alejandro Dal Bianco and Oscar Agustín Stanchi and Facundo Manuel Quiroga and Franco Ronchetti and Enzo Ferrante},
  journal= {arXiv preprint arXiv:2410.14506},
  year   = {2024}
}

备注

Accepted at IAI Workshop @ NeurIPS 2024