SyntheT2C:为Text2Cypher任务微调大语言模型生成合成数据
人工智能
2025-01-28 v2 计算与语言
摘要
将大语言模型(LLMs)与现有知识图谱(KG)数据库集成,为增强LLMs的有效性并减轻其“幻觉”提供了一条有前景的途径。由于大多数知识图谱驻留在仅能通过专用查询语言(如Cypher)访问的图数据库中,因此通过自动化将自然语言翻译为Cypher查询(称为“Text2Cypher”任务)来连接LLMs与知识图谱数据库至关重要。先前的努力试图通过监督微调(SFT)来增强LLMs在Cypher生成方面的能力。然而,这些探索受到缺乏查询-Cypher对标注数据集的阻碍,因为此类标注工作劳动密集且领域特定。在本研究中,我们提出了SyntheT2C,一种构建合成查询-Cypher对数据集的方法,包含两条不同的流水线:(1)基于LLM的提示和(2)模板填充。SyntheT2C被应用于两个医学知识图谱数据库,最终创建了一个合成数据集MedT2C。综合实验表明,MedT2C数据集通过SFT有效提升了骨干LLMs在Text2Cypher任务上的性能。SyntheT2C代码库和MedT2C数据集均已在 https://github.com/ZGChung/SyntheT2C 发布。
引用
@article{arxiv.2406.10710,
title = {SyntheT2C: Generating Synthetic Data for Fine-Tuning Large Language Models on the Text2Cypher Task},
author = {Ziije Zhong and Linqing Zhong and Zhaoze Sun and Qingyun Jin and Zengchang Qin and Xiaofan Zhang},
journal= {arXiv preprint arXiv:2406.10710},
year = {2025}
}
备注
COLING 2025 paper. 21 pages, 15 figures, 8 tables