面向指令跟随的说话提示数据集
计算与语言
2026-05-01 v2
摘要
语音大语言模型(SLLMs)正在快速扩展,支持广泛的任务。这些模型通常使用文本提示进行评估,而现实场景中用户与语音交互更为常见。为此,我们引入 DoWhatISay(DOWIS),一个由人类录制的口头和书面提示的数据集,旨在与任何现有基准配对,以在口头指令条件下对 SLLMs 进行真实求评。该数据集覆盖 9 项任务和 11 种语言,提供每个任务-语言组合的 10 种提示变体,跨五种风格。使用 DOWIS,我们对最先进的 SLLMs 进行基准测试,分析了提示模态、风格、语言和任务类型的相互作用。结果表明,文本提示在整体上优于口头提示,尤其在低资源和跨语言情境中尤为明显。仅在输出为语音的任务中,口头提示方能缩小差距,这凸显了在 SLLM 评估中需要语音化提示的重要性。
引用
@article{arxiv.2603.09881,
title = {Do What I Say: A Spoken Prompt Dataset for Instruction-Following},
author = {Maike Züfle and Sara Papi and Fabian Retkowski and Szymon Mazurek and Marek Kasztelnik and Alexander Waibel and Luisa Bentivogli and Jan Niehues},
journal= {arXiv preprint arXiv:2603.09881},
year = {2026}
}