面向 IPTC 新闻主题分类的无需人工标注数据的 LLM 教师-学生框架
计算与语言
2025-11-11 v2
摘要
随着在线新闻故事数量的不断增加,对它们进行主题分类(无论其撰写语言为何)已变得至关重要,以提高读者获取相关内容的能力。为解决这一挑战,我们提出一种基于大型语言模型(LLM)的教师-学生框架,用于开发无需手动数据标注即可获得较合理规模的新闻主题分类模型。该框架采用生成式预训练变换器(GPT)模型作为教师模型,通过自动标注 20,000 篇斯洛文尼亚语、克罗地亚语、希腊语和加泰罗尼亚语新闻文章开发新闻主题训练数据集。文章被分类到由国际新闻电信局(IPTC)开发的 17 个主要类别中。教师模型在所有四种语言中表现出高零样本性能,其与人类标注者的一致性相当于人类标注者之间的一致性。为缓解每日处理数百万篇文本的计算限制,我们在 GPT 标注的数据集上微调较小的 BERT 类学生模型。这些学生模型实现了与教师模型相当的高性能。此外,我们探讨了训练数据规模对学生模型性能的影响,研究了其单语种、多语种和零样本跨语言能力。研究结果表明,学生模型可通过相对较少的训练实例实现高性能,并展现出强大的零样本跨语言能力。最后,我们发布了表现最佳的新闻主题分类器,实现 IPTC 媒体主题模式的顶层类别的多语言分类。
引用
@article{arxiv.2411.19638,
title = {LLM Teacher-Student Framework for Text Classification With No Manually Annotated Data: A Case Study in IPTC News Topic Classification},
author = {Taja Kuzman and Nikola Ljubešić},
journal= {arXiv preprint arXiv:2411.19638},
year = {2025}
}
备注
This work has been accepted and published in the IEEE Access journal. This arXiv version is retained for archival purposes. Readers should use and cite the IEEE Access Version available at https://ieeexplore.ieee.org/document/10900365