WASIL: 野外阿拉伯语口语交互与LLM
声音
2026-05-19 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)语音助手通常构建为级联的自动语音识别(ASR)到LLM系统,其中识别错误可能扭曲用户意图。不喜欢也可能源于模糊、域外或非请求轮次,这使得隔离ASR效应变得困难。我们发布了WASIL(在阿拉伯语中表示连接或关联):包含音频、ASR假设、助手响应以及明确的喜欢/不喜欢反馈(8,529轮次;14.2%不喜欢)的野外阿拉伯语口语交互提示,以及一个包含现代标准阿拉伯语(MSA)和四种主要方言及其标签的2,000轮次测试集。我们通过多ASR一致性引导的后编辑提供低成本的金标准转录文本,并标注可回答性(可回答、模糊/需要澄清、不支持、非请求/噪声),以将内在的不可回答性与ASR引起的退化区分开来。最后,我们描述了使用多裁判LLM评分对来自ASR与金标准转录文本的响应进行可扩展的无参考评估。
引用
@article{arxiv.2605.16364,
title = {WASIL: In-the-Wild Arabic Spoken Interactions with LLMs},
author = {Zien Sheikh Ali and Hamdy Mubarak and Soon-Gyo Jung and Hunzalah Hassan Bhatti and Firoj Alam and Shammur Absar Chowdhury},
journal= {arXiv preprint arXiv:2605.16364},
year = {2026}
}
备注
Spoken Prompts, Multilingual LLMs, Speech-based Evaluation, Dialectal Speech, Low-resource Languages, Conversational AI, Speech-to-Text QA, Real-world Interaction, Spoken Language Understanding