Cequel:面向大规模文本聚类的经济型大语言模型查询框架
计算与语言
2025-08-22 v2 人工智能
摘要
文本聚类旨在根据文档的语言特征自动将文档划分为有意义的组。文献中,这一任务通常形式化为基于预训练文本嵌入的度量聚类或基于来自 oracle(如大型机器学习模型)的成对相似性的图聚类。近期大语言模型(LLM)的进展显著提升了该领域,提供高质量的上下文感知嵌入和准确的语义相似性估计。然而,由于需要大量 API 查询或推理调用,规模化利用 LLM 引入巨大的计算和经济成本。为此,我们提出 Cequel,一个在有限 LLM 查询预算下实现准确文本聚类的经济型框架。其核心设计利用 EdgeLLM 和 TriangleLLM 算法有针对性地查询具有信息性文本对或三元组,以构建 must-link 和 cannot-link 约束,然后在加权受约束聚类算法中利用这些约束形成高质量聚类。具体而言,EdgeLLM 和 TriangleLLM 采用精心设计的贪婪选择策略和提示技术高效识别和提取信息性约束。多个基准数据集上的实验表明,在相同查询预算下,Cequel 在无监督文本聚类中始终优于现有方法。
引用
@article{arxiv.2504.15640,
title = {Cequel: Cost-Effective Querying of Large Language Models for Text Clustering},
author = {Hongtao Wang and Taiyan Zhang and Renchi Yang and Jianliang Xu},
journal= {arXiv preprint arXiv:2504.15640},
year = {2025}
}