重新思考可分解任务的端到端评估:以口语理解为例
计算与语言
2021-06-30 v1 声音
音频与语音处理
摘要
可分解任务较为复杂,由层级化的子任务构成。例如,口语意图预测结合了自动语音识别与自然语言理解。然而,现有基准通常仅对表层子任务留出样本。因此,在这些基准上表现相近的模型,在其他子任务上可能存在未被观察到的性能差异。为了在竞争性的端到端架构之间进行有洞察力的比较,我们提出了一种利用针对子任务的效用函数进行坐标上升来构建鲁棒测试集的框架。给定可分解任务的数据集,我们的方法为每个子任务最优地创建测试集,以分别评估端到端模型的子组件。以口语理解为案例研究,我们为 Fluent Speech Commands 和 Snips SmartLights 数据集生成了新的划分。每个划分包含两个测试集:一个留出话语以评估自然语言理解能力,另一个留出说话人以测试语音处理技能。我们的划分识别出端到端系统之间高达 10% 的性能差距,而这些系统在原始测试集上的差异在 1% 以内。这些性能差距使得不同架构之间的比较更加真实且可操作,从而推动未来的模型开发。我们向社区发布我们的划分与工具。
引用
@article{arxiv.2106.15065,
title = {Rethinking End-to-End Evaluation of Decomposable Tasks: A Case Study on Spoken Language Understanding},
author = {Siddhant Arora and Alissa Ostapenko and Vijay Viswanathan and Siddharth Dalmia and Florian Metze and Shinji Watanabe and Alan W Black},
journal= {arXiv preprint arXiv:2106.15065},
year = {2021}
}
备注
INTERSPEECH 2021