Signformer 即是所需:迈向手语边缘 AI
计算与语言
2024-11-21 v1 计算机视觉与模式识别
计算机与社会
人机交互
机器学习
摘要
手语翻译,尤其是在无词汇标注范式下,正面临不可持续与不切实际的困境,这源于日益增长的资源密集型方法。当前的最先进技术严重依赖于预训练的复杂骨干网络,如大语言模型、嵌入源或大规模数据集,导致在实际场景的可持续应用中存在显著的参数与计算低效。尽管取得了成功,但遵循这一研究方向削弱了该领域创造实质价值以弥合听障人群与普通人群的总体使命。顺应 LLM 和自然语言处理研究的流行趋势,我们在架构上追求深刻的本质变革,以在不依赖预训练模型、先验知识迁移或任何非从零开始的 NLP 策略的情况下实现根本性改进。我们引入了 Signformer,这是一种从零开始的轻量级巨型模型,将这一领域引向边缘 AI,以具备 LLM 能力且可边缘部署的紧凑性重新定义了性能与效率的极限。在本文中,我们对自然手语进行了分析以指导算法设计,并提供了一种结合卷积与注意力机制创新的、可扩展的 Transformer 流水线。我们在排行榜上取得了新的第二名,与 2024 年最优秀的方法相比参数减少了 467-1807 倍,并在仅 0.57 百万参数的更轻量配置下击败了几乎所有其他方法。
引用
@article{arxiv.2411.12901,
title = {Signformer is all you need: Towards Edge AI for Sign Language},
author = {Eta Yang},
journal= {arXiv preprint arXiv:2411.12901},
year = {2024}
}
备注
Official Code at: https://github.com/EtaEnding/Signformer/tree/main