大语言模型作为教师:面向极端规模零样本标注
机器学习
2025-02-25 v2
摘要
极端多标签文本分类(XMC)需要从庞大的标签集中为实例选择最相关的标签。极端零样本XMC(EZ-XMC)通过在没有标注数据的情况下运行,仅依赖原始文本实例和预定义标签集,进一步扩展了这一挑战,使其对于解决大规模推荐和分类系统中的冷启动问题尤为关键。最先进的方法(如MACLR和RTS)利用轻量级双编码器,但依赖于次优的伪标签进行训练,例如文档标题(MACLR)或文档片段(RTS),这些可能与预期的标注或分类任务不一致。另一方面,基于LLM的方法(如ICXML)实现了更好的标签-实例对齐,但由于其高昂的推理成本,计算开销大且不适用于实际的EZ-XMC应用。在本文中,我们引入了LMTX(大语言模型作为教师用于极端分类),这是一个弥合这两种方法差距的新框架。LMTX在训练阶段利用LLM识别高质量的伪标签,同时采用轻量级双编码器进行高效推理。这种设计消除了推理时对LLM的需求,在提高标签对齐效果的同时不牺牲计算效率。我们的方法在性能和效率上均优于基于LLM和非LLM的方法,在EZ-XMC中建立了新的最先进水平。
引用
@article{arxiv.2406.09288,
title = {Large Language Model as a Teacher for Zero-shot Tagging at Extreme Scales},
author = {Jinbin Zhang and Nasib Ullah and Rohit Babbar},
journal= {arXiv preprint arXiv:2406.09288},
year = {2025}
}