中文

通过对合成数据进行微调以提高LLM在本体匹配中的性能

计算与语言 2025-12-01 v1

摘要

大型语言模型(LLM)正越来越多地被集成到本体匹配管道的各个组件中。本文探讨了LLM在本体模块上直接执行本体匹配并生成相应对齐方式的能力。进一步探讨了如何通过专门的微调策略在零样态设置下提升模型的匹配性能。该方法包含一种搜索空间缩减技术,用于从源本体和目标本体中选择相关子集,然后用于自动构建提示。鉴于为训练提供参考对齐方式稀缺,本文引入了一种基于LLM的新方法,用于生成合成数据集。该过程创建了一套本体子模块对及其相应的参考对齐,专为为本体匹配任务微调LLM而设计。我们在来自OAEI complex track的Conference、Geolink、Enslaved、Taxon和Hydrography数据集上评估了该方法。结果表明,对合成数据进行微调的LLM在性能上优于未微调的基础模型。该方法的关键贡献是将自动数据集生成与微调相结合,以有效地为本体匹配任务适配LLM。

关键词

引用

@article{arxiv.2511.22612,
  title  = {Improving LLM-based Ontology Matching with fine-tuning on synthetic data},
  author = {Guilherme Sousa and Rinaldo Lima and Cassia Trojahn},
  journal= {arXiv preprint arXiv:2511.22612},
  year   = {2025}
}