中文

DSTC 11 Track 4 中面向开放域对话系统的鲁棒多语言自动评测指标概述

计算与语言 2023-09-15 v3

摘要

神经网络的出现与快速发展革新了对话系统的研究,并随之引发了关于其自动评测的诸多挑战。开放域对话系统的自动评测作为一项开放挑战,一直是许多研究者关注的核心。尽管为提升自动指标与人类评测的相关性作出了持续努力,但评估其在多领域与多维度上鲁棒性的尝试甚少,且其重点主要放在英语上。所有这些挑战促使了在各种领域、维度和语言中均可靠的自动评测指标的发展。第 11 届对话系统技术挑战赛 (DSTC11) 中的本赛道是推进鲁棒多语言自动评测指标的持续努力的一部分。本文描述了提供给参与者的数据集与基线,并讨论了所提出的两个子任务的提交与结果细节。

关键词

引用

@article{arxiv.2306.12794,
  title  = {Overview of Robust and Multilingual Automatic Evaluation Metrics for Open-Domain Dialogue Systems at DSTC 11 Track 4},
  author = {Mario Rodríguez-Cantelar and Chen Zhang and Chengguang Tang and Ke Shi and Sarik Ghazarian and João Sedoc and Luis Fernando D'Haro and Alexander Rudnicky},
  journal= {arXiv preprint arXiv:2306.12794},
  year   = {2023}
}