基于生成对抗 BERT 的孟加拉语意图分类
计算与语言
2023-12-19 v1
摘要
意图分类是自然语言理解中的一项基础任务,旨在将用户查询或句子归类到预定义的类别中以理解用户意图。该任务最具挑战性的方面在于如何将所有可能的意图类别有效纳入数据集,同时确保充足的语言变化。在英语等丰富资源语言的相关领域已开展了大量研究。在本研究中,我们引入了 BNIntent30,一个包含 30 个意图类别的综合孟加拉语意图分类数据集。该数据集摘录并翻译自包含 150 个类别的多样化用户意图的 CLINIC150 数据集。此外,我们提出了一种使用生成对抗 BERT 进行孟加拉语意图分类的新方法来评估所提出的数据集,我们称之为 GAN-BnBERT。我们的方法利用基于 BERT 的上下文嵌入来捕获文本数据中显著的语言特征和上下文信息,而生成对抗网络(GAN)组件则通过生成式建模补充了模型学习现有意图类别多样化表示的能力。我们的实验结果表明,GAN-BnBERT 模型在最新引入的 BNIntent30 数据集上取得了优越的性能,超越了现有的 Bi-LSTM 和独立 BERT 分类模型。
引用
@article{arxiv.2312.10679,
title = {Bengali Intent Classification with Generative Adversarial BERT},
author = {Mehedi Hasan and Mohammad Jahid Ibna Basher and Md. Tanvir Rouf Shawon},
journal= {arXiv preprint arXiv:2312.10679},
year = {2023}
}