中文

ConvKGYarn:利用大型语言模型生成可配置且可扩展的对话式知识图谱QA数据集

计算与语言 2024-08-13 v1 信息检索 机器学习

摘要

大型语言模型(LLMs)和对话式助手的快速发展,使得动态、可扩展且可配置的对话数据集对于训练和评估成为必然需求。这些数据集必须适应多种用户交互模式,包括文本和语音,每种模式都带来独特的建模挑战。知识图谱(KGs),凭借其结构化和动态的特性,为当前和精确的知识提供了理想基础。虽然已存在人工编辑的基于知识图谱的数据集,但难以跟上用户信息需求日益变化的步伐。我们提出了ConvKGYarn,一种可生成最新且可配置对话式KGQA数据集的可扩展方法。定性心理测量分析确认,我们的方法能够生成与流行对话式KGQA数据集相当的高质量数据集,同时以规模化方式覆盖广泛的人类交互配置。我们展示了其实用性,通过在多样化的对话中测试大型语言模型——探索基于相同知识图谱事实集的不同配置下的模型行为。我们的结果凸显了ConvKGYarn提高知识图谱QA基础并评估大型语言模型参数化知识的能力,从而为不断演变的对话式助手领域提供了稳健的解决方案。

关键词

引用

@article{arxiv.2408.05948,
  title  = {ConvKGYarn: Spinning Configurable and Scalable Conversational Knowledge Graph QA datasets with Large Language Models},
  author = {Ronak Pradeep and Daniel Lee and Ali Mousavi and Jeff Pound and Yisi Sang and Jimmy Lin and Ihab Ilyas and Saloni Potdar and Mostafa Arefiyan and Yunyao Li},
  journal= {arXiv preprint arXiv:2408.05948},
  year   = {2024}
}