中文

UniDial-EvalKit:用于评估多方面对话能力的统一工具包

计算与语言 2026-03-25 v1

摘要

在多轮交互场景中对AI系统进行基准测试,对于理解其在实际应用中的实际能力至关重要。然而,现有的评估协议高度异构,数据格式、模型接口和评估管道差异巨大,严重阻碍了系统性比较。本文提出UniDial-EvalKit(UDE),用于评估交互式AI系统的统一工具包。UDE的核心贡献在于其整体统一性:将异构数据格式标准化为通用模式,通过模块化体系结构简化复杂的评估管道,并在一致的评分界面下对齐指标计算。它还支持通过并行生成和评分以及基于检查点的缓存,以消除冗余计算实现高效大规模评估。经过在多样化多轮基准测试的验证,UDE不仅通过标准化工作流程和透明日志确保高可重复性,而且显著提高了评估效率和可扩展性。我们公开完整的工具包和评估脚本,以促进标准化基准测试生态系统的建立,并加速交互式AI领域的未来突破。

关键词

引用

@article{arxiv.2603.23160,
  title  = {UniDial-EvalKit: A Unified Toolkit for Evaluating Multi-Faceted Conversational Abilities},
  author = {Qi Jia and Haodong Zhao and Dun Pei and Xiujie Song and Shibo Wang and Zijian Chen and Zicheng Zhang and Xiangyang Zhu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2603.23160},
  year   = {2026}
}