具有线性竞争单元的随机 Transformer 网络:在端到端手语翻译中的应用
计算与语言
2021-10-04 v2 机器学习
摘要
手语翻译(SLT)自动化是一项具有挑战性的现实应用。尽管其具有社会重要性,但该领域的研究进展仍然相当缓慢。关键在于,现有取得可行性能的方法需要依赖难以获取的 gloss 序列真值。在本文中,我们弱化了这一需求,引入了无需显式使用 gloss 的端到端 SLT 模型;该模型仅需文本真值。这与现有使用 gloss 序列真值的端到端模型形成鲜明对比,后者要么以在模型中间阶段被识别出的模态形式使用,要么以与 SLT 模型联合训练的并行输出过程形式使用。我们的方法构成了一种带有新型层的 Transformer 网络,该层结合了:(i) 具有随机胜者采样的局部胜者通吃(LWTA)层,以替代常规 ReLU 层;(ii) 具有通过变分推断估计后验分布的随机权重;以及 (iii) 推理时的权重压缩技术,其利用估计的后验方差实现大规模、几乎无损的压缩。我们证明,我们的方法可以在 PHOENIX 2014T 基准上达到当前报告的最佳 BLEU-4 分数,但无需使用 gloss 进行模型训练,且内存占用减少超过 70%。
引用
@article{arxiv.2109.13318,
title = {Stochastic Transformer Networks with Linear Competing Units: Application to end-to-end SL Translation},
author = {Andreas Voskou and Konstantinos P. Panousis and Dimitrios Kosmopoulos and Dimitris N. Metaxas and Sotirios Chatzis},
journal= {arXiv preprint arXiv:2109.13318},
year = {2021}
}
备注
In Proceedings of ICCV 2021