中文

低资源场景下大语言模型关系抽取性能如何?综合评估

计算与语言 2024-06-27 v2

摘要

关系抽取(RE)是将非结构化文本转换为结构化信息的关键技术,尤其是在知识图谱开发框架中发挥着重要作用,其重要性体现在各种下游任务中。除了基于神经网络和预训练语言模型的常规RE方法外,大语言模型(LLM)也被用于RE研究领域。然而,在低资源语言(LRL)上,常规RE方法和LLM-based方法都因数据稀缺问题在RE上表现不佳。为此,本文在三个地区(中亚、东南亚和中东)的10种低资源语言中构建了低资源关系抽取数据集。通过使用有效的多语言机器翻译将原始公开的英文RE数据集(NYT10、FewRel和CrossRE)翻译过来。随后,我们使用语言困惑度(PPL)筛选翻译数据集中的低质量数据。最后,我们对几个开源LLM在这些生成的LRL RE数据集上进行实证研究并验证了其性能。

关键词

引用

@article{arxiv.2406.11162,
  title  = {How Good are LLMs at Relation Extraction under Low-Resource Scenario? Comprehensive Evaluation},
  author = {Dawulie Jinensibieke and Mieradilijiang Maimaiti and Wentao Xiao and Yuanhang Zheng and Xiaobo Wang},
  journal= {arXiv preprint arXiv:2406.11162},
  year   = {2024}
}