面向开放式对话多维评估的神经模型与语言模型提示
计算与语言
2026-03-30 v2
摘要
随着基于生成式AI的对话系统日益增多,其评估已成为一项关键挑战。本文通过对话系统技术挑战赛(DSTC-12,赛道1)展示了我们对这一重要问题的贡献,我们开发了用于预测对话级别、特定维度分数的模型。鉴于使用相对较小模型(即参数少于130亿)的限制,我们的工作遵循两种主要策略:通过提示将语言模型(LM)用作评估器,以及训练基于编码器的分类和回归模型。我们的结果表明,虽然语言模型提示仅与人类判断达到中等相关性,但它在测试集上仍排名第二,仅次于基线模型。参数显著更少的回归和分类模型在验证集上对某些维度表现出高相关性。尽管它们在测试集上的性能有所下降,但需要注意的是,测试集包含的标注中,某些维度的分数范围与训练集和验证集存在显著差异。
引用
@article{arxiv.2509.00841,
title = {Neural Models and Language Model Prompting for the Multidimensional Evaluation of Open-Ended Conversations},
author = {Michelle Elizabeth and Alicja Kasicka and Natalia Krawczyk and Magalie Ochs and Gwénolé Lecorvé and Justyna Gromada and Lina M. Rojas-Barahona},
journal= {arXiv preprint arXiv:2509.00841},
year = {2026}
}
备注
This work was granted access to the HPC resources of IDRIS under the allocations AD011015150R1 made by GENCI