中文

面向真实场景:不平衡新意图发现

计算与语言 2024-06-06 v1

摘要

新意图发现(NID)旨在通过利用有限的标记数据和海量未标记数据,检测已知和previously未定义的用户意图类别。大多数先前的研究都在不切实际的假设下进行,即熟悉和新意图类别的分布是均匀的,忽略了在真实场景中常见的偏斜和长尾分布。为弥合这一差距,我们的工作引入了不平衡新意图发现(i-NID)任务,旨在识别长尾分布中的熟悉和新意图类别。创建了一个新基准(ImbaNID-Bench),包含三个数据集,用于模拟真实世界的长尾分布。ImbaNID-Bench涵盖从宽泛的跨域到特定的单域意图类别,提供了对实际应用场景的全面代表。此外,提出了一种稳健的基线模型ImbaNID,以实现聚类友好的意图表示。它包括三个阶段:模型预训练、可靠伪标签的生成,以及稳健的表示学习,从而增强了模型在处理真实世界数据分布复杂性方面的性能。我们在先前的基准以及新建立的基准上进行了大量实验,证明了ImbaNID在解决i-NID任务方面的优异性能,突显了其作为处理不平衡和长尾分布中用户意图发现和分类的强大基线模型的潜力\footnote{\url{https://github.com/Zkdc/i-NID}}。

关键词

引用

@article{arxiv.2406.03127,
  title  = {Towards Real-world Scenario: Imbalanced New Intent Discovery},
  author = {Shun Zhang and Chaoran Yan and Jian Yang and Jiaheng Liu and Ying Mo and Jiaqi Bai and Tongliang Li and Zhoujun Li},
  journal= {arXiv preprint arXiv:2406.03127},
  year   = {2024}
}

备注

ACL 2024