中文

FOFO:评估大语言模型格式遵循能力的基准

计算与语言 2024-03-01 v1

摘要

本文提出了 FoFo,这是一个开创性的基准,用于评估大语言模型(LLMs)遵循复杂、特定领域格式的能力,这是其作为 AI 代理应用的关键但尚未得到充分考察的能力。尽管 LLMs 取得了进展,但现有基准未能充分评估其格式遵循能力。FoFo 通过 AI-人类协作方法开发,包含多样化的现实世界格式和指令,填补了这一空白。我们对开源(如 Llama 2、WizardLM)和闭源(如 GPT-4、PALM2、Gemini)LLMs 的评估突出了三个关键发现:开源模型在格式遵循方面显著落后于闭源模型;LLMs 的格式遵循性能与其内容生成质量无关;LLMs 的格式熟练程度在不同领域间存在差异。这些见解表明需要对格式遵循技能进行专门微调,并突显了 FoFo 在指导特定领域 AI 代理选择中的作用。FoFo 在此发布:https://github.com/SalesforceAIResearch/FoFo。

关键词

引用

@article{arxiv.2402.18667,
  title  = {FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability},
  author = {Congying Xia and Chen Xing and Jiangshu Du and Xinyi Yang and Yihao Feng and Ran Xu and Wenpeng Yin and Caiming Xiong},
  journal= {arXiv preprint arXiv:2402.18667},
  year   = {2024}
}

备注

The first two authors contributed equally