面向本体学习的异构 LLM 方法(少样本提示、集成类型推断与基于注意力的分类体系)
计算与语言
2025-08-28 v1 计算机科学中的逻辑
符号计算
摘要
我们提出了一个综合系统,用于解决 LLMs4OL 2025 挑战赛的任务 A、B 和 C,这三个任务共同涵盖了完整的本体构建流程:术语抽取、类型推断和分类体系发现。我们的方法结合了检索增强提示、零样本分类和基于注意力的图建模——每种方法都针对相应任务的需求进行了定制。对于任务 A,我们使用检索增强生成(RAG)流程联合抽取领域特定术语及其本体类型。训练数据被重新表述为文档到术语和类型的对应关系,而测试时的推理则利用语义相似的训练样本。这种单次方法无需模型微调,并通过词汇增强提高了整体性能。任务 B 涉及为给定术语分配类型,通过双重策略处理。在少样本设置(针对有标注训练数据的领域)中,我们复用 RAG 方案并进行少样本提示。在零样本设置(针对以前未见过的领域)中,我们使用一个零样本分类器,该分类器利用基于置信度加权来结合来自多个嵌入模型的余弦相似度得分。在任务 C 中,我们将分类体系发现建模为图推理。利用类型标签的嵌入,我们训练了一个轻量级的交叉注意力层,通过近似软邻接矩阵来预测 is-a 关系。这些模块化的、特定于任务的解决方案使我们在所有三个任务的官方排行榜上均取得了顶尖排名。综合来看,这些策略展示了基于 LLM 的架构在跨异构领域本体学习方面的可扩展性、适应性和鲁棒性。代码可在以下地址获取:https://github.com/BelyaevaAlex/LLMs4OL-Challenge-Alexbek
引用
@article{arxiv.2508.19428,
title = {Heterogeneous LLM Methods for Ontology Learning (Few-Shot Prompting, Ensemble Typing, and Attention-Based Taxonomies)},
author = {Aleksandra Beliaeva and Temurbek Rahmatullaev},
journal= {arXiv preprint arXiv:2508.19428},
year = {2025}
}