面向任务导向查询的基准测试(ToQB)
信息检索
2024-06-06 v1 人工智能
计算与语言
人机交互
神经与进化计算
摘要
任务导向查询(例如,对视频播放、点餐或叫车等一次性查询)对于评估虚拟助手、聊天机器人及其他大型语言模型(LLM)服务的质量至关重要。然而,尚无针对任务导向查询的标准基准测试,因为相关NLP领域的现有基准测试主要聚焦于任务导向对话。因此,我们提出了一种新方法,用于高效生成任务导向查询基准测试(ToQB),该方法利用现有的任务导向对话数据集和LLM服务。我们的 метод论包括构建将说话者原始意图概括为每个对话的NLP任务、详细阐述执行所设定NLP任务的关键步骤、以及概述自动化基准测试生成过程的框架。通过涵盖三个领域(即两个单任务域和一个多任务域)的案例研究,我们演示了如何为这些领域定制LLM提示(例如,省略系统语句或说话者标签),并描述了生成的任务导向查询。公开了生成的ToQB数据集。我们进一步讨论了由社区贡献者可添加到ToQB中的新领域以及其实际应用。
引用
@article{arxiv.2406.02943,
title = {The Task-oriented Queries Benchmark (ToQB)},
author = {Keun Soo Yim},
journal= {arXiv preprint arXiv:2406.02943},
year = {2024}
}
备注
Data available on GitHub, https://github.com/google/task-oriented-queries