中文

面向任务导向查询的基准测试(ToQB)

信息检索 2024-06-06 v1 人工智能 计算与语言 人机交互 神经与进化计算

摘要

任务导向查询(例如,对视频播放、点餐或叫车等一次性查询)对于评估虚拟助手、聊天机器人及其他大型语言模型(LLM)服务的质量至关重要。然而,尚无针对任务导向查询的标准基准测试,因为相关NLP领域的现有基准测试主要聚焦于任务导向对话。因此,我们提出了一种新方法,用于高效生成任务导向查询基准测试(ToQB),该方法利用现有的任务导向对话数据集和LLM服务。我们的 метод论包括构建将说话者原始意图概括为每个对话的NLP任务、详细阐述执行所设定NLP任务的关键步骤、以及概述自动化基准测试生成过程的框架。通过涵盖三个领域(即两个单任务域和一个多任务域)的案例研究,我们演示了如何为这些领域定制LLM提示(例如,省略系统语句或说话者标签),并描述了生成的任务导向查询。公开了生成的ToQB数据集。我们进一步讨论了由社区贡献者可添加到ToQB中的新领域以及其实际应用。

关键词

引用

@article{arxiv.2406.02943,
  title  = {The Task-oriented Queries Benchmark (ToQB)},
  author = {Keun Soo Yim},
  journal= {arXiv preprint arXiv:2406.02943},
  year   = {2024}
}

备注

Data available on GitHub, https://github.com/google/task-oriented-queries