Tiny QA Benchmark++:超轻量化、合成多语言数据集生成与 LLM 持续评估的烟雾测试
人工智能
2025-05-20 v1 计算与语言
摘要
Tiny QA Benchmark++ (TQB++) 提供一个超轻量化、多语言的烟雾测试套件,为大语言模型 (LLM) 流水线提供即插即用的数据集,仅需数秒即可完成,成本极低。TQB++ 诞生于构建 Comet Opik 提示优化 SDK 的紧密反馈循环需求中,等待重型基准测试会打断开发流程。TQB++ 将包含 52 项英文金标准(小于 20 kB)与基于 LiteLLM 的无感知式轻量数据生成器 pypi 软件包相结合。该生成器允许实践者以任何语言、领域或难度级别自行生成小型数据包,而十个预设数据包已覆盖阿拉伯语、中文、法语、德语、日语、韩语、葡萄牙语、俄语、西班牙语和土耳其语。每个数据集均附带 Croissant 元数据及即插即用文件,支持 OpenAI-Evals、LangChain 和标准 CI 工具,使团队可直接将确定性微型基准测试集成到拉取请求门户、提示工程循环和生产仪表盘中,而无需消耗 GPU 资源。完整的 TQB++ 测试仅增加几秒钟的流水线延迟,却能可靠地在 MMLU 或 BIG-Bench 等重型基准测试配置完成前,提前捕获提示模板错误、标记化漂移及微调副作用。该框架已发布,以加速生成式 AI 生态系统中持续、资源高效的质量保证。
引用
@article{arxiv.2505.12058,
title = {Tiny QA Benchmark++: Ultra-Lightweight, Synthetic Multilingual Dataset Generation & Smoke-Tests for Continuous LLM Evaluation},
author = {Vincent Koc},
journal= {arXiv preprint arXiv:2505.12058},
year = {2025}
}
备注
28 pages, 7 figures, 3 tables. Includes expanded appendix & full score matrices. Dataset & code: HF Hub + GitHub + Pypi links in abstract. Core data and code Apache-2.0; synthetic packs eval-only