中文

聊天机器人 LLM 是否过于冗长?YapBench 基准测试

机器学习 2026-01-05 v1

摘要

大型语言模型(LLM)如 ChatGPT、Claude 和 Gemini 正越来越多地作为通用助手使用,但它们常对简单请求作出不必要的冗长回应,加入冗余解释、犹豫或模板内容,这增加认知负担并扩大基于 token 的推理成本。先前工作表明,偏好基于的后训练和 LLM 评估可导致系统性长度偏差,即使质量相当,较长的回答也会被奖励。我们引入 YapBench,一个用于量化用户可见冗长化的轻量级基准测试。每个项目包含一个单轮提示、精选的最小充分基线答案以及类别标签。我们的主要指标 YapScore 测量基线答案之外的额外响应长度(以字符为单位),可在不依赖特定分词器的情况下进行模型间比较。我们通过类别级别的中位数 YapScore 的均匀加权平均来总结模型性能,称为 YapIndex。YapBench 包含超过 300 个英文提示,涵盖三个常见的简洁理想场景:(A)最小或模糊输入,理想行为为简短澄清;(B)封闭形式的事实性问题,答案简短且稳定;(C)一行代码任务,仅需一条命令或代码片段即可完成。评估 76 个助手 LLM,观察到中位数冗长度跨度达一个数量级,并出现类别特定的不同失效模式,包括对模糊输入的空洞填充、对一行技术请求的解释或格式开销。我们发布了基准测试并维护一个实时排行榜,以追踪模型简洁性行为随时间的变化。

关键词

引用

@article{arxiv.2601.00624,
  title  = {Do Chatbot LLMs Talk Too Much? The YapBench Benchmark},
  author = {Vadim Borisov and Michael Gröger and Mina Mikhael and Richard H. Schreiber},
  journal= {arXiv preprint arXiv:2601.00624},
  year   = {2026}
}