葡萄牙语金融服务常见问题集
计算与语言
2023-11-21 v1 人工智能
机器学习
摘要
葡萄牙语金融领域特定数据的匮乏不利于自然语言处理(NLP)应用的发展。为应对这一局限,本研究主张利用通过数据增强技术生成的合成数据。研究聚焦于对源自巴西中央银行常见问题集的数据集进行增强,采用语义相似度各异的技术。我们开展了有监督与无监督任务,以评估增强数据在低语义相似度与高语义相似度场景下的影响。此外,所得数据集将在 Hugging Face Datasets 平台上公开发布,从而提升可及性并促进 NLP 研究社群更广泛的参与。
引用
@article{arxiv.2311.11331,
title = {Portuguese FAQ for Financial Services},
author = {Paulo Finardi and Wanderley M. Melo and Edgard D. Medeiros Neto and Alex F. Mansano and Pablo B. Costa and Vinicius F. Caridá},
journal= {arXiv preprint arXiv:2311.11331},
year = {2023}
}