中文

从 Facebook 主页聚类越南语对话以构建聊天机器人训练数据集

计算与语言 2022-03-03 v2

摘要

构建聊天机器人最大的挑战是训练数据。所需数据必须真实且足够大以训练聊天机器人。我们创建了一个工具,从 Facebook 主页的 Facebook messenger 获取实际训练数据。经过文本预处理步骤后,新获得的数据集生成 FVnC 和 Sample 数据集。我们使用越南语 BERT 的再训练版本(PhoBERT)来提取文本数据的特征。基于 PhoBERTbase_{base} 的输出嵌入,使用 K-Means 和 DBSCAN 聚类算法进行聚类任务。我们应用 V-measure 分数和 Silhouette 分数评估聚类算法的性能。我们还在 Sample 数据集和 wiki 数据集上展示了 PhoBERT 相较于其他模型在特征提取中的效率。还提出了一种结合两种聚类评估的 GridSearch 算法以寻找最优参数。通过对如此数量的对话进行聚类,我们节省了构建聊天机器人训练数据和故事线的大量时间与精力。

关键词

引用

@article{arxiv.2112.15338,
  title  = {Clustering Vietnamese Conversations From Facebook Page To Build Training Dataset For Chatbot},
  author = {Trieu Hai Nguyen and Thi-Kim-Ngoan Pham and Thi-Hong-Minh Bui and Thanh-Quynh-Chau Nguyen},
  journal= {arXiv preprint arXiv:2112.15338},
  year   = {2022}
}

备注

Preprint submitted to JJCIT (Revised version, December 10, 2021)