循环引入大语言模型的广义类别发现
计算与语言
2024-05-28 v2 人工智能
机器学习
摘要
广义类别发现 是一项关键任务,旨在利用仅包含已知类别的少量标注数据,从一组未标注数据中识别已知类别和新类别。由于缺乏监督和类别信息,当前方法通常在新类别上表现不佳,且难以揭示所发现聚类的语义含义,这限制了它们在现实世界中的应用。为了缓解上述问题,我们提出了 Loop,一种将大语言模型 引入训练循环的端到端主动学习框架,该框架可以在不依赖任何人工的情况下提升模型性能并生成类别名称。具体而言,我们首先提出局部不一致采样,基于邻域预测一致性和聚类分配概率的熵,选择更有可能落入错误聚类的样本。然后,我们提出一种可扩展查询 策略,允许 LLM 从多个候选样本中为所选样本选择真正的邻居。基于 LLM 的反馈,我们执行精化邻域对比学习,将样本及其邻居拉近以学习聚类友好的表示。最后,我们从对应于新类别的聚类中选择代表性样本,以允许 LLM 为它们生成类别名称。在三个基准数据集上的大量实验表明,Loop 以较大优势优于 SOTA 模型,并为发现的聚类生成了准确的类别名称。代码和数据获取地址:https://github.com/Lackel/LOOP。
引用
@article{arxiv.2312.10897,
title = {Generalized Category Discovery with Large Language Models in the Loop},
author = {Wenbin An and Wenkai Shi and Feng Tian and Haonan Lin and QianYing Wang and Yaqiang Wu and Mingxiang Cai and Luyan Wang and Yan Chen and Haiping Zhu and Ping Chen},
journal= {arXiv preprint arXiv:2312.10897},
year = {2024}
}
备注
Accepted by ACL 2024 Findings, code and data are available at https://github.com/Lackel/LOOP