MixRED: 一个混合语言关系抽取数据集
人工智能
2024-03-26 v1 计算与语言
摘要
关系抽取是自然语言处理中的关键任务,拥有众多实际应用。现有研究主要关注单语关系抽取或跨语言增强。然而,在混合语言(或代码切换)场景下,个体在句子中混合使用不同语言的内容,产生混合语言内容,对关系抽取的理解仍存在显著空白。由于缺乏专门的数据集,现有关系抽取模型在此场景下的有效性尚未得到充分探索。为解决此问题,我们引入了一个新任务,考虑混合语言场景下的关系抽取,称为MixRE,并构建了人工标注数据集MixRED来支持该任务。除了构建MixRED数据集,我们还在MixRED上评估了最先进的监督模型和大语言模型(LLM),揭示了它们在混合语言场景下的各自优势和局限性。此外,我们深入研究了影响MixRE任务中模型性能的因素,并发现了增强监督模型和LLM在此新任务中性能的有前景方向。
引用
@article{arxiv.2403.15696,
title = {MixRED: A Mix-lingual Relation Extraction Dataset},
author = {Lingxing Kong and Yougang Chu and Zheng Ma and Jianbing Zhang and Liang He and Jiajun Chen},
journal= {arXiv preprint arXiv:2403.15696},
year = {2024}
}