FOFO:评估大语言模型格式遵循能力的基准
计算与语言
2024-03-01 v1
摘要
本文提出了 FoFo,这是一个开创性的基准,用于评估大语言模型(LLMs)遵循复杂、特定领域格式的能力,这是其作为 AI 代理应用的关键但尚未得到充分考察的能力。尽管 LLMs 取得了进展,但现有基准未能充分评估其格式遵循能力。FoFo 通过 AI-人类协作方法开发,包含多样化的现实世界格式和指令,填补了这一空白。我们对开源(如 Llama 2、WizardLM)和闭源(如 GPT-4、PALM2、Gemini)LLMs 的评估突出了三个关键发现:开源模型在格式遵循方面显著落后于闭源模型;LLMs 的格式遵循性能与其内容生成质量无关;LLMs 的格式熟练程度在不同领域间存在差异。这些见解表明需要对格式遵循技能进行专门微调,并突显了 FoFo 在指导特定领域 AI 代理选择中的作用。FoFo 在此发布:https://github.com/SalesforceAIResearch/FoFo。
引用
@article{arxiv.2402.18667,
title = {FOFO: A Benchmark to Evaluate LLMs' Format-Following Capability},
author = {Congying Xia and Chen Xing and Jiangshu Du and Xinyi Yang and Yihao Feng and Ran Xu and Wenpeng Yin and Caiming Xiong},
journal= {arXiv preprint arXiv:2402.18667},
year = {2024}
}
备注
The first two authors contributed equally