LAUD:将大语言模型集成用于无标签数据的主动学习
机器学习
2025-11-19 v1
摘要
大语言模型(LLM)展示出超越其预训练数据泛化的显著能力,微调 LLM 可将性能提升至人类水平甚至更高。然而,在实际场景中,缺乏标注数据常常阻碍实践者获得表现良好的模型,从而迫使他们高度依赖基于提示的做法,这些做法往往繁琐、低效且依赖试错。为缓解标注数据不足的问题,我们提出了一种将 LLM 与主动学习集成用于无标签数据集的学习框架(LAUD)。LAUD 通过零样本学习构建初始标签集,从而缓解冷启动问题。实验结果表明,LAUD 派生的 LLM 在商品名称分类任务中优于零样本或少样本学习的 LLM,展示了 LAUD 的有效性。
引用
@article{arxiv.2511.14738,
title = {LAUD: Integrating Large Language Models with Active Learning for Unlabeled Data},
author = {Tzu-Hsuan Chou and Chun-Nan Chou},
journal= {arXiv preprint arXiv:2511.14738},
year = {2025}
}
备注
7 pages and one figure