超越传统基准:分析开放 LLM 在数据到文本生成上的行为
计算与语言
2024-06-07 v3
摘要
我们分析了开放大型语言模型(LLM)在数据到文本(D2T)生成任务上的行为,即从结构化数据生成连贯且相关的文本。为了避免 LLM 训练数据与传统基准发生污染的问题,我们设计了 Quintd——一种从公共 API 收集新颖结构化数据记录的工具。我们发现,开放 LLM(Llama 2、Mistral 和 Zephyr)在零样本设置下,能够从使用 Quintd 收集的常见格式数据中生成流畅且连贯的文本。然而,我们表明输出的语义准确性是一个主要问题:根据人工标注者和我们基于 GPT-4 的无参考指标,超过 80% 的开放 LLM 输出包含至少一个语义错误。我们公开发布了代码、数据和模型输出。
引用
@article{arxiv.2401.10186,
title = {Beyond Traditional Benchmarks: Analyzing Behaviors of Open LLMs on Data-to-Text Generation},
author = {Zdeněk Kasner and Ondřej Dušek},
journal= {arXiv preprint arXiv:2401.10186},
year = {2024}
}
备注
Accepted to ACL 2024 Main Conference