FFN:面向金融领域的细粒度中英平行语料库
计算与语言
2024-06-28 v1 人工智能
计算工程、金融与科学
摘要
大型语言模型(LLM)在机器翻译领域取得了令人瞩目的进展,尽管其在金融领域的效果仍有待广泛探索。为此,我们构建了一个名为FFN的金融新闻细粒度中英平行语料库。我们获取了自2014年1月1日至2023年12月31日期间的主流媒体网站(如CNN、FOX和China Daily)上的金融新闻文章。该数据集包含1,013篇正文和809篇标题,所有内容均经过人工校对。我们测量了两种大型语言模型(ChatGPT和ERNIE-bot)的翻译质量,采用BLEU、TER和chrF等评估指标。与此同时,我们还基于本数据集训练了一个基于OpenNMT的模型。我们详细阐述了大型语言模型的问题并进行深入分析,旨在激发该 largely 未探索领域的进一步研究与解决方案。我们的研究强调,在确保金融翻译准确性和质量的前提下,需优化大型语言模型的金融领域应用。
引用
@article{arxiv.2406.18856,
title = {FFN: a Fine-grained Chinese-English Financial Domain Parallel Corpus},
author = {Yuxin Fu and Shijing Si and Leyi Mai and Xi-ang Li},
journal= {arXiv preprint arXiv:2406.18856},
year = {2024}
}
备注
a simplified version of this paper is accepted by International Conference on Asian Language Processing 2024