中文

利用似真负例评估与改进聊天机器人文本分类数据质量

信息检索 2019-06-06 v1 计算与语言 机器学习

摘要

我们描述并验证了一种基于交叉验证、适用于改进聊天机器人设计中使用的小型不平衡自然语言数据集的多类分类器性能估计度量。我们的经验来自构建招聘聊天机器人,其通过将 ML/NLP 数据集暴露给招聘团队来中介求职者与招聘者之间的沟通。评估方法须为各利益相关方所理解,并有助于提升聊天机器人性能。该度量 nex-cv 在文本分类评估中使用负例,并满足三项要求。首先,它是可操作的:非开发人员也可使用。其次,相比人工评分它不会过度乐观,从而成为比较分类器的快速方法。第三,它允许与模型无关的比较,使其能跨越实现差异比较系统。我们基于一年内英德两种语言的七个招聘领域数据集对该度量进行了验证。

关键词

引用

@article{arxiv.1906.01910,
  title  = {Evaluation and Improvement of Chatbot Text Classification Data Quality Using Plausible Negative Examples},
  author = {Kit Kuksenok and Andriy Martyniv},
  journal= {arXiv preprint arXiv:1906.01910},
  year   = {2019}
}

备注

Included in the ACL2019 1st workshop on NLP for Conversational AI (Florence, Italy). Code available: https://github.com/jobpal/nex-cv