基于大语言模型多样性的文本分类数据质量增强:未覆盖、困难与噪声数据
计算与语言
2024-12-11 v2
摘要
近年来,大语言模型(LLMs)在文本分类中的应用引起了广泛关注。尽管如此,LLMs的分类准确率尚未普遍超越较小模型。LLMs可以通过微调来提高其在文本分类中的性能。然而,基于LLMs的现有数据质量研究难以直接应用于解决文本分类问题。为进一步提高LLMs在分类任务中的性能,本文提出了一种基于LLMs的文本分类数据质量增强(DQE)方法。该方法首先使用贪心算法选择数据,将数据集划分为采样子集和未采样子集,然后使用采样数据对LLMs进行微调。随后,该模型用于预测未采样数据的结果,将预测错误的数据分为未覆盖数据、困难数据和噪声数据。实验结果表明,我们的方法有效增强了LLMs在文本分类任务中的性能,并显著提高了训练效率,节省了近一半的训练时间。我们的方法在多个开源分类任务中取得了最先进性能。
引用
@article{arxiv.2412.06575,
title = {Data Quality Enhancement on the Basis of Diversity with Large Language Models for Text Classification: Uncovered, Difficult, and Noisy},
author = {Min Zeng and Caiquan Liu and Shiqi Zhang and Li Xie and Chen Sang and Xiaoxin Chen},
journal= {arXiv preprint arXiv:2412.06575},
year = {2024}
}
备注
Accepted by COLING 2025(main, long paper)