中文

由大语言模型驱动的面向可视化的自然语言数据集生成框架

人机交互 2024-01-23 v4

摘要

我们介绍了 VL2NL,一个仅以 Vega-Lite 规范作为输入即可生成丰富多样自然语言(NL)数据集的大语言模型(LLM)框架,从而简化数据可视化自然语言接口(NLI)的开发。为准确合成相关图表语义并增强各 NL 数据集的句法多样性,我们利用 1)融入提示的引导式发现,使 LLM 能以自我导向的方式生成忠实的 NL 数据集;2)基于评分的改写,沿四个语言维度扩充 NL 句法。我们还呈现了包含 1,981 个真实世界 Vega-Lite 规范的新集合,其多样性和复杂度均高于现有图表集合。在我们的图表集合上测试时,VL2NL 提取图表语义并生成 L1/L2 标题的准确率分别为 89.4% 和 76.0%。相比基准,其在生成和改写话语及问题上也展现出更高的多样性。最后,我们讨论了我们的 NL 数据集与框架如何在真实场景中使用。代码与图表集合可在 https://github.com/hyungkwonko/chart-llm 获取。

关键词

引用

@article{arxiv.2309.10245,
  title  = {Natural Language Dataset Generation Framework for Visualizations Powered by Large Language Models},
  author = {Hyung-Kwon Ko and Hyeon Jeon and Gwanmo Park and Dae Hyun Kim and Nam Wook Kim and Juho Kim and Jinwook Seo},
  journal= {arXiv preprint arXiv:2309.10245},
  year   = {2024}
}

备注

22 pages, 5 figures