基于 BiLSTM-Attention 的高效机器翻译方法
计算与语言
2024-11-01 v2
摘要
随着自然语言处理(NLP)技术的快速发展,机器翻译的准确性和效率已成为研究热点。本文提出一种新颖的 Seq2Seq 模型,旨在提高翻译质量,同时减少模型所需的存储空间。该模型采用双向长短期记忆网络(Bi-LSTM)作为编码器,以捕获输入序列的上下文信息;解码器则融合了注意力机制,增强了模型在翻译过程中聚焦关键信息的能力。与当前主流的 Transformer 模型相比,我们的模型在 WMT14 机器翻译数据集上取得了更优的性能,同时保持了更小的模型体积。研究首先介绍了模型架构的设计原理与创新点,随后通过一系列实验验证了模型的有效性。实验包括评估模型在不同语言对上的表现,以及与传统 Seq2Seq 模型的对比分析。结果表明,在保持翻译准确性的前提下,我们的模型显著降低了存储需求,这对于资源受限场景下的翻译应用具有重要意义。我们的代码可在 https://github.com/mindspore-lab/models/tree/master/research/arxiv_papers/miniformer 获取。感谢 MindSpore 社区提供的支持。
引用
@article{arxiv.2410.22335,
title = {Efficient Machine Translation with a BiLSTM-Attention Approach},
author = {Yuxu Wu and Yiren Xing},
journal= {arXiv preprint arXiv:2410.22335},
year = {2024}
}