ConvKGYarn:利用大型语言模型生成可配置且可扩展的对话式知识图谱QA数据集
计算与语言
2024-08-13 v1 信息检索
机器学习
摘要
大型语言模型(LLMs)和对话式助手的快速发展,使得动态、可扩展且可配置的对话数据集对于训练和评估成为必然需求。这些数据集必须适应多种用户交互模式,包括文本和语音,每种模式都带来独特的建模挑战。知识图谱(KGs),凭借其结构化和动态的特性,为当前和精确的知识提供了理想基础。虽然已存在人工编辑的基于知识图谱的数据集,但难以跟上用户信息需求日益变化的步伐。我们提出了ConvKGYarn,一种可生成最新且可配置对话式KGQA数据集的可扩展方法。定性心理测量分析确认,我们的方法能够生成与流行对话式KGQA数据集相当的高质量数据集,同时以规模化方式覆盖广泛的人类交互配置。我们展示了其实用性,通过在多样化的对话中测试大型语言模型——探索基于相同知识图谱事实集的不同配置下的模型行为。我们的结果凸显了ConvKGYarn提高知识图谱QA基础并评估大型语言模型参数化知识的能力,从而为不断演变的对话式助手领域提供了稳健的解决方案。
引用
@article{arxiv.2408.05948,
title = {ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA datasets with Large Language Models},
author = {Ronak Pradeep and Daniel Lee and Ali Mousavi and Jeff Pound and Yisi Sang and Jimmy Lin and Ihab Ilyas and Saloni Potdar and Mostafa Arefiyan and Yunyao Li},
journal= {arXiv preprint arXiv:2408.05948},
year = {2024}
}