StarDrinks:用于饮品订购场景下SLU评估的英语和韩语测试集
计算与语言
2026-04-30 v1
摘要
大型语言模型(LLM)和语音助手越来越多地用于任务导向交互,但其评估常常依赖于受控场景,无法捕捉真实用户请求的变动性和复杂性。例如饮品订购,涉及多样化的专有实体、饮品类型、规格、定制选项以及品牌特定术语,以及自然语音现象如停顿和自我纠错。为此,我们引入StarDrinks,一个包含语音语料、转录文本和标注槽位的英语和韩语测试集。该数据集支持语音到槽位SLU、转录到槽位NLU和语音到转录ASR评估,为模型在语言丰富、真实任务中的鲁棒性和泛化能力提供了现实基准。
引用
@article{arxiv.2604.26500,
title = {StarDrinks: An English and Korean Test Set for SLU Evaluation in a Drink Ordering Scenario},
author = {Marcely Zanon Boito and Caroline Brun and Inyoung Kim and Denys Proux and Salah Ait-Mokhtar and Nikolaos Lagos and Jean-Luc Meunier and Ioan Calapodescu},
journal= {arXiv preprint arXiv:2604.26500},
year = {2026}
}
备注
Accepted at LREC 2026