中文

TRUEBench:作为生产力助手的 LLM 响应能否满足现实世界约束?

计算与语言 2025-09-30 v1 人工智能

摘要

大型语言模型(LLMs)作为生产力助手日益不可或缺,但现有基准测试在严格评估其真实世界指令遵循能力方面存在不足。当前基准测试通常(i)缺乏足够的多语言性,(ii)未能捕捉用户请求中固有的隐含约束,以及(iii)忽视了多轮对话的复杂性。为解决这些关键差距并提供更真实的评估,我们引入了 TRUEBench(可信赖真实世界使用评估基准),这是一个专为基于 LLM 的生产力助手设计的新型基准测试。TRUEBench 的独特之处在于:提供涵盖 12 种语言的输入提示,纳入实例内多语言指令,采用严格的评估标准以捕捉显性和隐性约束,并包含具有累积约束和上下文切换的复杂多轮对话场景。此外,为确保评估的可靠性,我们使用 LLM 验证器对约束进行了细化。大量实验表明,TRUEBench 比现有基准测试提出了显著更大的挑战;例如,像 OpenAI o1 这样的强大模型仅取得了 69.07% 的总体通过率。TRUEBench 为实际生产力环境中的 LLM 提供了一个严苛且现实的评估,突显了它们的能力与局限性。

关键词

引用

@article{arxiv.2509.22715,
  title  = {TRUEBench: Can LLM Response Meet Real-world Constraints as Productivity Assistant?},
  author = {Jiho Park and Jongyoon Song and Minjin Choi and Kyuho Heo and Taehun Huh and Ji Won Kim},
  journal= {arXiv preprint arXiv:2509.22715},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings