中文

面向软件工程聊天机器人数据的Transformer-based数据增强方法

软件工程 2024-07-17 v1

摘要

背景:聊天机器人已被广泛应用于软件开发任务,受成本降低和开发进程加速等优势驱动。聊天机器人通过自然语言理解组件(NLU)理解用户查询。要获得合理性能,NLU必须使用广泛且高质量的数据集进行训练,这些数据表达了用户可能与聊天机器人交互的多种方式。然而,先前研究表明,为软件工程聊天机器人创建高质量训练数据集在资源和时间方面的成本都很高。目标:因此,本文提出一种自动基于Transformer的数据增强方法,用于扩充软件工程聊天机器人数据集。方法:我们的方法将传统自然语言处理技术与BART Transformer结合,用于通过同义替换和改写来生成查询。我们评估了使用该增强方法对Rasa NLU性能的影响,选取了三个软件工程数据集进行测试。结果:总体而言,增强方法在改善Rasa性能方面显示出前景,通过生成具有不同句子结构的查询,同时保持原始语义不变。此外,它提高了Rasa对正确分类意图的置信度。结论:我们认为本研究帮助实践者提升聊天机器人性能,并指导未来研究提出面向SE聊天机器人的增强技术。

关键词

引用

@article{arxiv.2407.11955,
  title  = {A Transformer-based Approach for Augmenting Software Engineering Chatbots Datasets},
  author = {Ahmad Abdellatif and Khaled Badran and Diego Elias Costa and Emad Shihab},
  journal= {arXiv preprint arXiv:2407.11955},
  year   = {2024}
}