借助跨语言迁移构建日语文档级关系抽取数据集
计算与语言
2024-04-26 v1
摘要
文档级关系抽取是从文档中提取所有语义关系的任务。虽然已有关于英语文档级关系抽取的研究,但对非英语语言的文档级关系抽取关注有限。本文深入探讨如何有效利用现有的英语资源来促进非英语语言的文档级关系抽取研究,并以日语作为代表性案例。作为初步尝试,我们通过将英语数据集迁移到日语来构建一个数据集。然而,在此类数据集上训练的模型召回率较低。我们调查了错误案例,并将失败归因于从英语翻译而来的文档与母语者撰写的文档在表面结构和语义上的差异。因此,我们转而探索迁移后的数据集是否能够辅助对日语文档的人工标注。在我们的方案中,标注员编辑一个在迁移数据集上训练的模型给出的关系预测。定量分析表明,与先前方法相比,模型提供的关系建议帮助减少了约50%的人工编辑步骤。实验量化了现有文档级关系抽取模型在我们收集的数据集上的性能,描绘了日语和跨语言文档级关系抽取所面临的挑战。
引用
@article{arxiv.2404.16506,
title = {Building a Japanese Document-Level Relation Extraction Dataset Assisted by Cross-Lingual Transfer},
author = {Youmi Ma and An Wang and Naoaki Okazaki},
journal= {arXiv preprint arXiv:2404.16506},
year = {2024}
}
备注
Accepted LREC-COLING 2024