continual relation extraction 的后训练语言模型
计算与语言
2025-08-26 v3
摘要
现实世界的数据(如新闻文章、社交媒体帖子和聊天机器人对话)具有内在的动态和非平稳特性,为构建实时结构化表示(如知识图谱)带来了显著挑战。关系抽取(RE)是知识图谱创建的基本组成部分,面临着当传统模型依赖静态过时数据集时难以适应数据演变的问题。持续关系抽取(CRE)方法通过逐步学习新关系同时保持先前获取的知识来解决此问题。本研究探索将预训练语言模型(PLMs),特别是大语言模型(LLMs),应用于CRE,重点利用记忆回放技术以解决灾难性遗忘问题。我们在TACRED和FewRel数据集上评估了解码器模型(如Mistral-7B和Llama2-7B)和编码器-解码器模型(如Flan-T5 Base)。针对LLMs的任务递进微调在TACRED上显示出优于使用BERT等编码器模型的先前方法的优势,尤其在Mistral和Flan-T5模型上表现突出,尤其在已见任务准确率和整体性能(以整体准确率和平均准确率衡量)方面。FewRel结果同样令人鼓舞,实现了整体和平均准确率的第二名。本工作强调了知识传递、语言模型架构和知识图谱完整性方面的关键因素,推动了CRE与LLMs及记忆回放技术在动态实时关系抽取中的应用。
引用
@article{arxiv.2504.05214,
title = {Post-Training Language Models for Continual Relation Extraction},
author = {Sefika Efeoglu and Adrian Paschke and Sonja Schimmler},
journal= {arXiv preprint arXiv:2504.05214},
year = {2025}
}
备注
17 pages, Initial Results and Reporting of the work. This work has been submitted to the IEEE for possible publication