LUMI:基于多个伪标签的无监督意图聚类
计算与语言
2026-02-26 v4 信息检索
摘要
本文提出了一种直观、无训练、无标签的方法,用于对话搜索中的意图聚类。当前的短文本聚类方法使用 LLM 生成的伪标签来丰富文本表示或识别相似文本对以进行池化。其局限性在于:(1)每个文本仅分配单个标签,向单个标签细化表示可能不稳定;(2)文本级别的相似性被视为二元选择,无法考虑相似性的连续程度。我们的 метод LUMI 旨在通过使用共享伪标签来放大文本之间的相似性。我们首先为每个文本生成伪标签并收集成伪标签集合。随后计算伪标签嵌入的均值并与文本嵌入进行池化。最后进行文本级别池化:每个文本表示与其相似配对进行池化,其中相似性由共享标签的程度决定。我们在四个基准数据集上的评估显示,我们的方法在竞争性结果方面优于最近的 SOTA baseline,同时避免了大多数方法在嵌入细化过程中需要估计聚类数量的需求。我们的发现表明,LUMI 可以有效应用于无监督短文本聚类场景。
引用
@article{arxiv.2510.14640,
title = {LUMI: Unsupervised Intent Clustering with Multiple Pseudo-Labels},
author = {I-Fan Lin and Faegheh Hasibi and Suzan Verberne},
journal= {arXiv preprint arXiv:2510.14640},
year = {2026}
}