介绍用于孟加拉手语翻译与研究的孟加拉句子-词汇对数据集
计算与语言
2025-11-12 v1 人工智能
摘要
孟加拉手语(Bangla Sign Language, BdSL)翻译代表一个低资源 NLP 任务,由于缺乏解决句子水平翻译的大规模数据集。相应地,该领域的现有研究仅限于词和字母级别的检测。本文我们引入了 Bangla-SGP,一个新颖的平行数据集,包含 1000 个人工标注的句子-词汇对,经过一套基于句法和形态规则的规则方法通过检索增强生成(RAG)管道合成生成了约 3000 个人工标注的句子-词汇对。句子的词汇序列由支持孟加拉手语单词的单个词汇组成,作为连续手势的中间表示。我们的数据集包含 1000 个高质量的孟加拉句子,这些句子由专业手语译者手动标注为词汇序列。增强过程包含我们通过批判性分析人工标注的句子-词汇对并与专业手语译者紧密合作所采用的基于规则的语言策略和提示工程技术。此外,我们对几种基于变换器的模型进行了微调,包括 mBart50、Google mT5、GPT4.1-nano,并根据 BLEU 分数对其进行句子到词汇翻译性能评估。基于这些评估指标,我们比较了模型在我们数据集和 RWTH-PHOENIX-2014T 基准数据集上的词汇翻译一致性。
引用
@article{arxiv.2511.08507,
title = {Introducing A Bangla Sentence - Gloss Pair Dataset for Bangla Sign Language Translation and Research},
author = {Neelavro Saha and Rafi Shahriyar and Nafis Ashraf Roudra and Saadman Sakib and Annajiat Alim Rasel},
journal= {arXiv preprint arXiv:2511.08507},
year = {2025}
}