利用加权语法与语义上下文评估汇总(wSSAS)实现基于大语言模型的文本分类
计算与语言
2026-04-15 v1 人工智能
摘要
大型语言模型(LLM)用于可靠的企业级分析(如文本分类)时,常受注意力机制的随机性及对噪声的敏感性限制,导致分析精度和可重复性受损。为解决这些技术障碍,本文引入加权语法与语义上下文评估汇总(wSSAS),一种旨在对大规模混乱数据集强制数据完整性的确定性框架。我们提出了两阶段验证框架:首先将原始文本组织成包含主题、故事和簇的层次化分类结构;随后利用信噪比(SNR)优先排序高价值语义特征,确保模型注意力集中于最具代表性的数据点。通过将该评分机制融入汇总-汇总(Summary-of-Summaries, SoS)架构,框架有效隔离关键信息并在数据聚合过程中抑制背景噪声。基于 Gemini 2.0 Flash Lite 的实验结果表明,wSSAS 在包括 Google Business 评论、Amazon 产品评论和 Goodreads 书籍评论等多样数据集上显著提升了聚类完整性和分类准确性。我们的发现表明,wSSAS 降低了分类熵,为基于高精度、确定性过程的大规模文本分类提供了可复现的提升路径。
引用
@article{arxiv.2604.12049,
title = {Leveraging Weighted Syntactic and Semantic Context Assessment Summary (wSSAS) Towards Text Categorization Using LLMs},
author = {Shreeya Verma Kathuria and Nitin Mayande and Sharookh Daruwalla and Nitin Joglekar and Charles Weber},
journal= {arXiv preprint arXiv:2604.12049},
year = {2026}
}