从混沌中有序:十大领先大语言模型在非结构化数据分类中的比较研究
计算与语言
2025-10-17 v1 人工智能
摘要
本研究对十个最先进的大语言模型(LLM)应用于非结构化文本分类进行比较评估,使用交互式广告局(IAB)2.2层次化分类学。分析采用统一的数据集,包含8660个人工标注样本,以及相同的零样本提示,确保所有模型之间的方法论一致性。评估指标包括四项经典指标——准确率、精确率、召回率和F1分数,以及三项LLM特有的指标:幻觉比率、膨胀比率和分类成本。结果显示,尽管这些模型取得了快速进展,当前的LLM仅实现了中等程度的经典性能,平均分为34%的准确率、42%的精确率、45%的召回率和41%的F1分数。幻觉和膨胀比率表明,模型经常相对于人类标注者过度生成类别。经过评估的系统中,Gemini 1.5/2.0 Flash和GPT 20B/120B在性价比方面表现最佳,而GPT 120B显示出最低的幻觉比率。这些发现表明,仅凭规模扩张和架构改进并不足以确保更好的分类准确性,因为该任务要求将丰富的非结构化文本压缩到有限的分类学中——这一过程挑战了当前的模型架构。为解决这些限制,本文开发并测试了一种基于集成的方法。该集成方法中,多个LLM作为独立专家协同工作,显著提高了准确率,减少了膨胀,并完全消除了幻觉现象。这些结果表明,协调性地组织模型——而非仅凭规模——可能是实现或超越人类专家性能在大规模文本分类中最有效的路径。
引用
@article{arxiv.2510.13885,
title = {Order from Chaos: Comparative Study of Ten Leading LLMs on Unstructured Data Categorization},
author = {Ariel Kamen},
journal= {arXiv preprint arXiv:2510.13885},
year = {2025}
}
备注
10 pages, 4 figures,