中文

基于语言模型的本体新概念放置框架

计算与语言 2024-03-05 v2 信息检索

摘要

我们研究了将从文本中提取的新概念插入本体中的任务。我们探索了包含三个步骤的方法:边搜索用于查找一组候选插入位置(即概念之间的子包含关系),边形成与丰富化以利用本体结构产生并增强边候选,以及边选择最终定位要插入的边。在所有步骤中,我们提出利用神经方法,其中我们应用基于嵌入的方法和对预训练语言模型(PLM)如BERT的对比学习进行边搜索,并采用BERT微调的多标签边交叉编码器,以及大语言模型(LLM)如GPT系列、FLAN-T5和Llama 2进行边选择。我们在使用SNOMED CT本体和MedMentions实体链接基准创建的最新数据集上对方法进行评估。我们框架的最佳配置使用微调的PLM进行搜索和多标签交叉编码器进行选择。零样本提示LLM对该任务仍不够理想,我们提出对LLM进行可解释指令微调以提高性能。我们的研究表明PLM的优势,并彰显了LLM令人鼓舞的性能,这激励着未来的研究。

关键词

引用

@article{arxiv.2402.17897,
  title  = {A Language Model based Framework for New Concept Placement in Ontologies},
  author = {Hang Dong and Jiaoyan Chen and Yuan He and Yongsheng Gao and Ian Horrocks},
  journal= {arXiv preprint arXiv:2402.17897},
  year   = {2024}
}

备注

20 pages, 3 figures, accepted for ESWC 2024