探索机器翻译生成命名实体数据集的潜力:以波斯语与英语为例
计算与语言
2025-02-21 v1 人工智能
摘要
本研究聚焦于通过对英语数据集应用机器翻译来生成波斯语命名实体数据集。通过使用一个单语和一个多语Transformer模型进行实验来评估所生成的数据集。值得注意的是,CoNLL 2003数据集取得了85.11%的最高F1分数。相比之下,WNUT 2017数据集的F1分数最低,为40.02%。本研究的结果凸显了机器翻译在为波斯语等低资源语言创建高质量命名实体识别数据集方面的潜力。该研究将这些生成的数据集与英语命名实体识别系统的性能进行了比较,并提供了关于机器翻译在该任务中有效性的见解。此外,该方法可用于扩充低资源语言的数据或创建噪声数据,以使命名实体系统更鲁棒并得以改进。
引用
@article{arxiv.2302.09611,
title = {Exploring the Potential of Machine Translation for Generating Named Entity Datasets: A Case Study between Persian and English},
author = {Amir Sartipi and Afsaneh Fatemi},
journal= {arXiv preprint arXiv:2302.09611},
year = {2025}
}