中文

LLM 实现短文本聚类的包式文本表示

计算与语言 2026-01-13 v2 人工智能

摘要

本文提出一种基于 LLM 的无训练短文本聚类方法,减少了对嵌入器精确选择的依赖。对于客户面向的聊天机器人,公司面临大量用户 utterance 需要根据意图进行聚类。在此类场景中,通常没有可用标签数据,聚类数量也未知。近期的无标签设置下的短文本聚类方法会利用 LLM 输出来细化现有嵌入。虽然 LLM 能有效识别相似文本,但所得相似性可能不直接由密集向量空间中的距离表示,因为它们取决于原始嵌入。我们因此提出一种方法,将 LLM 判断直接转换为包式文本表示,其中文本初始化为等距,而无需假设任何先验距离关系。我们的 method 在 comparable 或优于最先进方法的成果方面取得了 comparable 或更好的结果,但无需嵌入优化或假设聚类或标签的先验知识。在多样化数据集和较小的 LLM 上实验表明,我们的方法对模型具有不依赖性,可应用于任何嵌入器,适用于较小的 LLM 和不同聚类方法。我们还展示了该方法如何扩展到大型数据集,减少了 LLM 使用的计算成本。该方法的灵活性和可扩展性使其更符合实际的无训练场景,而现有的聚类方法则不然。

关键词

引用

@article{arxiv.2510.06747,
  title  = {LLMs Enable Bag-of-Texts Representations for Short-Text Clustering},
  author = {I-Fan Lin and Faegheh Hasibi and Suzan Verberne},
  journal= {arXiv preprint arXiv:2510.06747},
  year   = {2026}
}