中文

评估基于任务的聊天机器人:为 Dialogflow 提供快照和精选数据集

音频与语音处理 2026-03-11 v2 计算与语言 声音

摘要

近年来,随着聊天机器人在任何时间、任何领域都能为用户提供帮助这一能力的广泛应用,聊天机器人获得了广泛关注。然而,缺乏大规模的精选数据集限制了对其质量和可靠性的研究。本文提出了 TOFU-D,一个来自 GitHub 的 1,788 个 Dialogflow 聊天机器人快照;以及 COD,一个来自 TOFU-D 的包含 185 个经验证聊天机器人的精选子集。这两个数据集捕获了广泛的领域、语言和实现模式,为对聊天机器人质量和安全性进行经验性研究提供了稳固的基础。使用 Botium 测试框架和 Bandit 静态分析器进行的初步评估揭示了测试覆盖率不足以及多个聊天机器人中频繁出现的安全漏洞,凸显了系统性、跨平台聊天机器人质量和安全性研究的必要性。

关键词

引用

@article{arxiv.2601.19786,
  title  = {Rethinking Discrete Speech Representation Tokens for Accent Generation},
  author = {Jinzuomu Zhong and Yi Wang and Korin Richmond and Peter Bell},
  journal= {arXiv preprint arXiv:2601.19786},
  year   = {2026}
}