SommBench:评估语言模型酒师专业能力
计算与语言
2026-03-13 v1 人工智能
摘要
随着大型语言模型的快速发展,系统评估它们的多语言和多文化能力变得越来越重要。以往的文化评估基准主要关注可以编码为语言形式的基础文化知识。本文提出了 SommBench,一个用于评估酒师专业能力的多语言基准,该领域深植于嗅觉和味觉的感官之中。虽然语言模型仅通过文本描述学习感官属性,但 SommBench 测试文本 grounding 是否足以模拟专家水平的感官判断。SommBench 包含三个主要任务:酒理论问答 (WTQA)、酒特征填补 (WFC) 和食酒搭配 (FWP)。SommBench 以多种语言提供:英语、斯洛伐克语、瑞典语、芬兰语、德语、丹麦语、意大利语和西班牙语。这有助于将语言模型的酒知识与其语言技能分离。基准数据集由专业酒师和各语言的母语者紧密合作开发,包含 1,024 个酒理论问答问题、1,000 个酒特征填补示例和 1,000 个食酒搭配示例。我们提供了最流行语言模型的结果,包括闭源模型如 Gemini 2.5 和开源模型如 GPT-OSS 和 Qwen 3。我们的结果显示,最具能力的模型在酒理论问答方表现良好(闭源模型最高可达 97% 正确),但特征填补(峰值达 65%)和食酒搭配(MCC 范围在 0 到 0.39)表现更具挑战性。这些结果将 SommBench 定位为评估语言模型酒师专业能力的有趣且具挑战性的基准。该基准已公开于 https://github.com/sommify/sommbench。
引用
@article{arxiv.2603.12117,
title = {SommBench: Assessing Sommelier Expertise of Language Models},
author = {William Brach and Tomas Bedej and Jacob Nielsen and Jacob Pichna and Juraj Bedej and Eemeli Saarensilta and Julie Dupouy and Gianluca Barmina and Andrea Blasi Núñez and Peter Schneider-Kamp and Kristian Košťál and Michal Ries and Lukas Galke Poech},
journal= {arXiv preprint arXiv:2603.12117},
year = {2026}
}