增强领域特定编码器模型的 LLM 生成数据:如何利用本体法,以及如何在没有本体的情况下实现
计算与语言
2025-11-25 v2 机器学习
摘要
我们探讨了使用 LLM 生成数据用于 specialized domains 中 limited training data 的 encoder 模型持续预训练的方法,以侵入生物学科学领域为案例研究。为此,我们利用 domain-specific 本体通过丰富 them 来获取 LLM 生成数据,并将 encoder 模型预训练为用于 concept 定义的 ontology-informed embedding model。为评估该方法的有效性,我们构建了一个专为评估 invasion biology 中模型性能而设计的基准。经过展示在标准 LLM 预训练之外实现显著改进后,我们研究了在没有 comprehensive 本体的域中应用该方法的可行性,通过用从小语料库中自动提取的科学摘要中的概念来替代本体概念,并通过分布统计建立概念之间的关系。我们的结果表明,这种自动方法仅使用小套件科学摘要即可实现与之相当的性能, resulting in 一个 fully 自动的 pipeline 用于增强 small encoder 模型的 domain-specific 理解,尤其适用于 low-resource 设置,性能相当于在大数据集上进行的 masked language modeling 预训练。
引用
@article{arxiv.2503.22006,
title = {Enhancing Domain-Specific Encoder Models with LLM-Generated Data: How to Leverage Ontologies, and How to Do Without Them},
author = {Marc Brinner and Tarek Al Mustafa and Sina Zarrieß},
journal= {arXiv preprint arXiv:2503.22006},
year = {2025}
}
备注
Published in the Findings of the Association for Computational Linguistics: EMNLP 2025