中文

JaParaPat:一个大规模日英平行专利申请语料库

计算与语言 2025-08-25 v1

摘要

我们构建了 JaParaPat(Japanese-English Parallel Patent Application Corpus),这是一个包含超过 30 亿日英句子对的双语语料库,来自 2000 年至 2021 年间发布的日本和美国专利申请。我们获取了日本专利局(JPO)和美国专利商标局(USPTO)的未经审查专利申请出版信息。我们还从欧洲专利局(EPO)维护的书目数据库 DOCDB 中获取了专利族信息。我们提取了约 140 万日英文档对,这些文档是基于专利族的互为翻译,我们使用以字典基方法初始化的翻译基句子对齐方法,从文档对中提取约 35 亿句子对。我们通过在 2200 万句子对(来自网络)上添加超过 30 亿句子对(来自专利申请),在实验中将专利翻译准确率提高了 20 个 BLEU 分。

关键词

引用

@article{arxiv.2508.16303,
  title  = {JaParaPat: A Large-Scale Japanese-English Parallel Patent Application Corpus},
  author = {Masaaki Nagata and Katsuki Chousa and Norihito Yasuda},
  journal= {arXiv preprint arXiv:2508.16303},
  year   = {2025}
}

备注

LREC-COLING 2024